diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/README.md new file mode 100644 index 0000000000000000000000000000000000000000..ef5f64faff8041ba0b806a7d500e804e6c3a283f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/README.md @@ -0,0 +1,58 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: transformers +model_name: Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1 +tags: +- generated_from_trainer +- trl +- sft +licence: license +--- + +# Model Card for Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1 + +This model is a fine-tuned version of [Qwen/Qwen3.5-4B-Base](https://huggingface.co/Qwen/Qwen3.5-4B-Base). +It has been trained using [TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from transformers import pipeline + +question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?" +generator = pipeline("text-generation", model="None", device="cuda") +output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0] +print(output["generated_text"]) +``` + +## Training procedure + +[Visualize in Weights & Biases](https://wandb.ai/katriin-kukk/Cross_lingual_morphological_generalization/runs/mq7in2f1) + + + +This model was trained with SFT. + +### Framework versions + +- TRL: 0.29.0 +- Transformers: 5.5.4 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + + + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/README.md new file mode 100644 index 0000000000000000000000000000000000000000..28c9af374285086f1c66ae341c34b93e41de0cba --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/README.md @@ -0,0 +1,58 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: transformers +model_name: Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2 +tags: +- generated_from_trainer +- trl +- sft +licence: license +--- + +# Model Card for Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2 + +This model is a fine-tuned version of [Qwen/Qwen3.5-4B-Base](https://huggingface.co/Qwen/Qwen3.5-4B-Base). +It has been trained using [TRL](https://github.com/huggingface/trl). + +## Quick start + +```python +from transformers import pipeline + +question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?" +generator = pipeline("text-generation", model="None", device="cuda") +output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0] +print(output["generated_text"]) +``` + +## Training procedure + +[Visualize in Weights & Biases](https://wandb.ai/katriin-kukk/Cross_lingual_morphological_generalization/runs/gtp4i6ta) + + + +This model was trained with SFT. + +### Framework versions + +- TRL: 0.29.0 +- Transformers: 5.5.4 +- Pytorch: 2.10.0 +- Datasets: 4.6.1 +- Tokenizers: 0.22.2 + +## Citations + + + +Cite TRL as: + +```bibtex +@software{vonwerra2020trl, + title = {{TRL: Transformers Reinforcement Learning}}, + author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin}, + license = {Apache-2.0}, + url = {https://github.com/huggingface/trl}, + year = {2020} +} +``` \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4e2c0cb87592557b2e0b777b18355d538da4a1e9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-100/trainer_state.json @@ -0,0 +1,139 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.24140012070006034, + "eval_steps": 20, + "global_step": 100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9897324005793792.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d52a66f922983baf4b7708bc8c1c62a0fa065562 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1000/trainer_state.json @@ -0,0 +1,1084 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4103802051901027, + "eval_steps": 20, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.8038608775637e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..74975bdc6174ea63fb70de63db1e142d8ccd0e76 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1020/trainer_state.json @@ -0,0 +1,1105 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4586602293301145, + "eval_steps": 20, + "global_step": 1020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0007168784646349e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..294ebe3a07f37c7f2253819b28a70ea82df8bbe4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1040/trainer_state.json @@ -0,0 +1,1126 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.506940253470127, + "eval_steps": 20, + "global_step": 1040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0198081900655616e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..407be8578f8f9715455c10f0b50df2715d7de8b8 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1060/trainer_state.json @@ -0,0 +1,1147 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.5552202776101387, + "eval_steps": 20, + "global_step": 1060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0385749388429107e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7c3f7c0059398e17d28cbe3ad17c1cd561472cb6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1080/trainer_state.json @@ -0,0 +1,1168 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.603500301750151, + "eval_steps": 20, + "global_step": 1080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0583776570652467e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bee2e41c45a36d30435ba9eab57e5700ac4512aa --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json @@ -0,0 +1,1189 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.651780325890163, + "eval_steps": 20, + "global_step": 1100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0779277426032845e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5b8775179929192efb85de85d21760ce0884e54b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json @@ -0,0 +1,1210 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.700060350030175, + "eval_steps": 20, + "global_step": 1120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0975532670678835e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..53cac2f79c5b82f613cb0f75ddbd22ca96571a85 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json @@ -0,0 +1,1231 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.748340374170187, + "eval_steps": 20, + "global_step": 1140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1159542247710925e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c87d762141a7ca7e179c91a3a3f2c2a475632d32 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json @@ -0,0 +1,1252 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.796620398310199, + "eval_steps": 20, + "global_step": 1160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1362964190380237e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3f67e8446b62e27bae6624608038e8c9842d5bbb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json @@ -0,0 +1,1273 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8449004224502112, + "eval_steps": 20, + "global_step": 1180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1553096601219277e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9a9c3c2a531dd004c4b0ec82483eefda4b865d50 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json @@ -0,0 +1,160 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.28968014484007243, + "eval_steps": 20, + "global_step": 120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2000140223848448e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..81ecc3a28e9e1407929bb80072b219927f537c56 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json @@ -0,0 +1,1294 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8931804465902236, + "eval_steps": 20, + "global_step": 1200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1750869396364698e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a50eb773303a5c057ee27e02074e41c1c7ae1ad0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json @@ -0,0 +1,1315 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9414604707302354, + "eval_steps": 20, + "global_step": 1220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.19498878109952e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e80a97e70bcb9c97ed1adfc8263c4a8e3372a57d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json @@ -0,0 +1,1336 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9897404948702473, + "eval_steps": 20, + "global_step": 1240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2137441263182029e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..60f547b242c87199ebf25b18d08591c5d551e709 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json @@ -0,0 +1,1357 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.036210018105009, + "eval_steps": 20, + "global_step": 1260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2326518844844442e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..332cecf04279532d3c8bad77cdcbe8d1a65bc11f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json @@ -0,0 +1,1378 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.084490042245021, + "eval_steps": 20, + "global_step": 1280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2543756637436314e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d5ad5e937d3c4b84b22af8f8bbe25ce68aa31ac3 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json @@ -0,0 +1,1399 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1327700663850333, + "eval_steps": 20, + "global_step": 1300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2752494392837734e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ac3478328063f859c71862d70ca61c441f8b1a44 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json @@ -0,0 +1,1420 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.181050090525045, + "eval_steps": 20, + "global_step": 1320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2964977778662605e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ba125efad50d1dd7176776b1d1e3424dea108738 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json @@ -0,0 +1,1441 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2293301146650575, + "eval_steps": 20, + "global_step": 1340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3153899657889382e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5194ff4aa85ee5959c570cb49e4ceb70a5db8edc --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json @@ -0,0 +1,1462 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2776101388050694, + "eval_steps": 20, + "global_step": 1360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3352751405123994e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6489d837cef993c2efc54f9b41fc570cce69fcf4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json @@ -0,0 +1,1483 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3258901629450817, + "eval_steps": 20, + "global_step": 1380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.353556799448023e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bc2c17decc6786466fd63b700fd8ca8f03690aae --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json @@ -0,0 +1,181 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.33796016898008446, + "eval_steps": 20, + "global_step": 140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4166816370434048e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..088c5fb9bd16bcc536119229d62d2f6314a24f0a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json @@ -0,0 +1,1504 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3741701870850935, + "eval_steps": 20, + "global_step": 1400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3721270561375846e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..71e74a25bf49138f382a82fc16e0c2eb5f530274 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json @@ -0,0 +1,1525 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4224502112251054, + "eval_steps": 20, + "global_step": 1420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3915490709398323e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..305009f07e968518d6de4b373df9873868119f74 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json @@ -0,0 +1,1546 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4707302353651177, + "eval_steps": 20, + "global_step": 1440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4106009086838374e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..af128f47c793515e14b4c70d689a28e87ad10dbd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json @@ -0,0 +1,1567 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.51901025950513, + "eval_steps": 20, + "global_step": 1460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.430731698517033e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..13b41f75062153b0f1c01a850003bea2a6ba7022 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json @@ -0,0 +1,1588 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.567290283645142, + "eval_steps": 20, + "global_step": 1480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4509668747718656e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b98d411894115a8fa8bc216dc86ddabfb7025101 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json @@ -0,0 +1,1609 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6155703077851538, + "eval_steps": 20, + "global_step": 1500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.470379240409088e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..66c6a384b4e38adb7abb59653387a0ccba85d082 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json @@ -0,0 +1,1630 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.663850331925166, + "eval_steps": 20, + "global_step": 1520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4890284448124928e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d7e064d67f1fbbf5793c017e69c9b8f0a1034adb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json @@ -0,0 +1,1651 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.712130356065178, + "eval_steps": 20, + "global_step": 1540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5089864268720538e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e9ba6e1c4a38cf05f02040cfea74c9c2d1bb784e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json @@ -0,0 +1,1672 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7604103802051903, + "eval_steps": 20, + "global_step": 1560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.528082124457083e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..744c0b8d7ab996f1fb39b7d087fb4241a2537a4b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json @@ -0,0 +1,1693 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.808690404345202, + "eval_steps": 20, + "global_step": 1580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5468058905902285e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..945b18aac792ef942e90e133d4739d17aa451936 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json @@ -0,0 +1,202 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.38624019312009655, + "eval_steps": 20, + "global_step": 160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6047701792907264e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..76cc434ab65d0ff04d4d0774a02924e1c105df04 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json @@ -0,0 +1,1714 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.856970428485214, + "eval_steps": 20, + "global_step": 1600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5667805393893786e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f962b4ccb042f123aaffc5aa64cb48b8210afd9b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json @@ -0,0 +1,1735 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9052504526252263, + "eval_steps": 20, + "global_step": 1620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5864385201363354e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7b7066690474ff355bac5901d964cc22c5d0f15f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json @@ -0,0 +1,1756 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9535304767652386, + "eval_steps": 20, + "global_step": 1640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.606152641479803e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..387cccee220087408d27b2ec3ce922eff3d66f50 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json @@ -0,0 +1,1777 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.0, + "eval_steps": 20, + "global_step": 1660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6246204854405734e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ab02a9e1ce73480530d9d9e58512c9ed34bcef60 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json @@ -0,0 +1,1798 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.048280024140012, + "eval_steps": 20, + "global_step": 1680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.644855661695406e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4c0f7d8241c409a662b07b4bfbe4a956051cf784 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json @@ -0,0 +1,1819 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.096560048280024, + "eval_steps": 20, + "global_step": 1700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6634952169337856e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5d7b22ed986ce139fecd3992aed232e418099a96 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json @@ -0,0 +1,1840 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.1448400724200365, + "eval_steps": 20, + "global_step": 1720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6840961842627584e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f5626e5417a0fc82f910c2c0472e3ef432be532f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json @@ -0,0 +1,1861 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.193120096560048, + "eval_steps": 20, + "global_step": 1740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7031883730605056e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b138c0e56e1c1d97219a5d9fb051d1f21117a1ec --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json @@ -0,0 +1,1882 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.24140012070006, + "eval_steps": 20, + "global_step": 1760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.722359509572096e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b96299fefa9b92a089c1706ac63a07ceaf9dbd42 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json @@ -0,0 +1,1903 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.289680144840072, + "eval_steps": 20, + "global_step": 1780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7419517005575168e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..160ec58aa6af5df5cb61b415e493c10d3777adfa --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json @@ -0,0 +1,223 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.43452021726010864, + "eval_steps": 20, + "global_step": 180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.800621913399296e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..374b1f7f68c07f0d737a6c168d446bc832940831 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json @@ -0,0 +1,1924 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.337960168980085, + "eval_steps": 20, + "global_step": 1800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7626254752225894e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e3101dab1100823853b186c862869418deebe1e1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json @@ -0,0 +1,1945 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.386240193120097, + "eval_steps": 20, + "global_step": 1820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7815615229862912e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7b11139a3ec8dbc8169cee2d837f4c12ced4f7a5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json @@ -0,0 +1,1966 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.434520217260109, + "eval_steps": 20, + "global_step": 1840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8004984479468134e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..63c36d787fe7b62ca08e522b886a1db21d8574e5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json @@ -0,0 +1,1987 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.4828002414001205, + "eval_steps": 20, + "global_step": 1860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8212880125921894e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b3f73ffd8e04d83a8575f22feb039e93600738a6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json @@ -0,0 +1,2008 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.531080265540133, + "eval_steps": 20, + "global_step": 1880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8415258204374835e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2ad930305095fca12c7b63763edb7b4d5bf760c5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json @@ -0,0 +1,2029 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.579360289680145, + "eval_steps": 20, + "global_step": 1900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8598951990551552e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f0a9aa299943d8a6f9fb1e2115d0b402fdf15270 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json @@ -0,0 +1,2050 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.627640313820157, + "eval_steps": 20, + "global_step": 1920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8793058102987366e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..77b67615d29f9b5335eff7fbe0865f1549f13ba0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json @@ -0,0 +1,2071 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.675920337960169, + "eval_steps": 20, + "global_step": 1940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.898451508102533e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..eb81f5dc271f19ec233a805cdbda973c0357736d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json @@ -0,0 +1,2092 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.724200362100181, + "eval_steps": 20, + "global_step": 1960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.91863931572906e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9f3131f7a59f38140099b6f22f325aeb538af96d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-20/trainer_state.json @@ -0,0 +1,55 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.049813200498132, + "eval_steps": 20, + "global_step": 20, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2024853289033728.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..31b4a66609035bd5da49e13e8a4b203ac981dd9a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-200/trainer_state.json @@ -0,0 +1,244 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.49813200498132004, + "eval_steps": 20, + "global_step": 200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0027099623612416e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7a5e24c23e7414eb8e07c96fafe2bc2ac51041c5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.976338729763388, + "eval_steps": 20, + "global_step": 2000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.973209163101225e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d84d74180b651ecd849288aa294a13fe367aaf48 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2020/trainer_state.json @@ -0,0 +1,2155 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.024906600249066, + "eval_steps": 20, + "global_step": 2020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9920107951972352e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d748ba373d102b22b9484ae81d325898095e579b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2040/trainer_state.json @@ -0,0 +1,2176 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.074719800747198, + "eval_steps": 20, + "global_step": 2040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0125268072666726e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1f4ded21a4214e4f0d66ecad689776647bc88899 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2060/trainer_state.json @@ -0,0 +1,2197 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.12453300124533, + "eval_steps": 20, + "global_step": 2060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0320025227972608e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a8816c25ba75f18f339c30bc6541fc2b80070b47 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2080/trainer_state.json @@ -0,0 +1,2218 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.174346201743462, + "eval_steps": 20, + "global_step": 2080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.052914368148521e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2a341474e032c17badf23a326271e95831a2a75c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2100/trainer_state.json @@ -0,0 +1,2239 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.224159402241594, + "eval_steps": 20, + "global_step": 2100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0744841404738765e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..22b53cd2a737c34fdb31b1b9d856e72a241265c9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2120/trainer_state.json @@ -0,0 +1,2260 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.273972602739726, + "eval_steps": 20, + "global_step": 2120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0924151188661043e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..18b1bd90edc78e283a65985979cab9cd062893ed --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2140/trainer_state.json @@ -0,0 +1,2281 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.323785803237858, + "eval_steps": 20, + "global_step": 2140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.111302021170217e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a00e12d343a7264ccbc8987eb10dd290e0a41432 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2160/trainer_state.json @@ -0,0 +1,2302 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.37359900373599, + "eval_steps": 20, + "global_step": 2160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1310784263820083e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..07f9e15090fdf880338835d2ee6ab951ef9a30cf --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2180/trainer_state.json @@ -0,0 +1,2323 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.423412204234122, + "eval_steps": 20, + "global_step": 2180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1495650074986086e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7bd9a34976e5920edaf7e69350ec73402fed26f9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-220/trainer_state.json @@ -0,0 +1,265 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.547945205479452, + "eval_steps": 20, + "global_step": 220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2106705362059264e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6910bf18f6872fcfabe995e78d90a96cf3f3392f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2200/trainer_state.json @@ -0,0 +1,2344 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.473225404732254, + "eval_steps": 20, + "global_step": 2200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1719847891615744e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..acb11849d9ad494a177d4c3e7d1213c6f72dbbc6 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2220/trainer_state.json @@ -0,0 +1,2365 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.523038605230386, + "eval_steps": 20, + "global_step": 2220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.190705638955172e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e4f5c355b98c44af536eee754055e21173d274c9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2240/trainer_state.json @@ -0,0 +1,2386 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.572851805728518, + "eval_steps": 20, + "global_step": 2240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2098716889931776e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ff9b0e7e556216ccf17bfb7f6584f5f678630bd7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2260/trainer_state.json @@ -0,0 +1,2407 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.62266500622665, + "eval_steps": 20, + "global_step": 2260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2298195322023117e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d59f7088467b83b3d0982d3bc1ff038c5e69eedc --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2280/trainer_state.json @@ -0,0 +1,2428 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.672478206724782, + "eval_steps": 20, + "global_step": 2280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2491624057244877e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..937774316cec4875988dcc1b4d47bddcb6f98a19 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2300/trainer_state.json @@ -0,0 +1,2449 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.722291407222914, + "eval_steps": 20, + "global_step": 2300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.268772758425764e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..97742f684137dd910948fc680fc35337c185ff0a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2320/trainer_state.json @@ -0,0 +1,2470 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.772104607721046, + "eval_steps": 20, + "global_step": 2320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.288900117862482e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dd1a763b4d3a290a998d420d57f4f1afaeb3ebfe --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2340/trainer_state.json @@ -0,0 +1,2491 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.821917808219178, + "eval_steps": 20, + "global_step": 2340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3074028554395648e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8783024645511d7f3b5e164203bd2acc49cb7792 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2360/trainer_state.json @@ -0,0 +1,2512 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.87173100871731, + "eval_steps": 20, + "global_step": 2360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.32657339338326e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9d10ba61fc725c71310384bca8d2a57f1d270af5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2380/trainer_state.json @@ -0,0 +1,2533 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.921544209215442, + "eval_steps": 20, + "global_step": 2380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.346658566506496e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..34560b822dd26d0008a095c51faa5169115bd57c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-240/trainer_state.json @@ -0,0 +1,286 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.597758405977584, + "eval_steps": 20, + "global_step": 240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4041441504845824e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..85596505e1e791cd0b792a32f1a5963c9b7c0af1 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2400/trainer_state.json @@ -0,0 +1,2554 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.971357409713574, + "eval_steps": 20, + "global_step": 2400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.366798492079145e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..06a2d9dcdf457f832c9d32947e477ac7d343e7a5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2420/trainer_state.json @@ -0,0 +1,2575 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.019925280199253, + "eval_steps": 20, + "global_step": 2420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.385955790701056e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..134c2a447601c8b97d27b364cdb0568b1eb5d9ae --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2440/trainer_state.json @@ -0,0 +1,2596 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.069738480697385, + "eval_steps": 20, + "global_step": 2440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4063452438300467e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0340e44c48d6f6952e3c63b8d02becb8b0c886f7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2460/trainer_state.json @@ -0,0 +1,2617 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.119551681195516, + "eval_steps": 20, + "global_step": 2460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4259789336409088e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bf1b4f2886783238586a10fda2d4c569ffbd53aa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2480/trainer_state.json @@ -0,0 +1,2638 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.169364881693649, + "eval_steps": 20, + "global_step": 2480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4449421303417446e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3f03768a7c2e0d78f6be75852c13e307698fcb4a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2500/trainer_state.json @@ -0,0 +1,2659 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.219178082191781, + "eval_steps": 20, + "global_step": 2500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4654087754485965e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e57c3345d4fa92b2c744b636d636132d814db7df --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2520/trainer_state.json @@ -0,0 +1,2680 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.268991282689913, + "eval_steps": 20, + "global_step": 2520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.484802811095634e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5943ab2f41c6dfff646ddf4527ebad0067111355 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2540/trainer_state.json @@ -0,0 +1,2701 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.318804483188045, + "eval_steps": 20, + "global_step": 2540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5037830618380902e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2dadbbdf79daa81ce42b5b584cf4d03247682c3b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2560/trainer_state.json @@ -0,0 +1,2722 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.3686176836861765, + "eval_steps": 20, + "global_step": 2560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5240683955550822e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8057c3d23db98004a9948a429c5dc345c3f38cba --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2580/trainer_state.json @@ -0,0 +1,2743 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.418430884184309, + "eval_steps": 20, + "global_step": 2580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5429140091268506e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..88ef678cb2c331a7b37839a96b8c38c3db582af8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-260/trainer_state.json @@ -0,0 +1,307 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6475716064757161, + "eval_steps": 20, + "global_step": 260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.606270446932787e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..794161eff33b6cee4a5de5093bbfe09c8f401050 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2600/trainer_state.json @@ -0,0 +1,2764 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.468244084682441, + "eval_steps": 20, + "global_step": 2600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.56277747970902e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e6d90725153834e1bccd36eff0820aad366b6721 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2620/trainer_state.json @@ -0,0 +1,2785 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.518057285180573, + "eval_steps": 20, + "global_step": 2620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5808583541512806e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..18a66dd3c51a9747d211f2886a62455b8c33f445 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2640/trainer_state.json @@ -0,0 +1,2806 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.567870485678705, + "eval_steps": 20, + "global_step": 2640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.601385137194373e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ca8c8519a5b9eab50ae333228dac51155694260e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2660/trainer_state.json @@ -0,0 +1,2827 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.617683686176837, + "eval_steps": 20, + "global_step": 2660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.622312241424978e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c17d9b6986952fe96bdfac1033a11db38fa6e22e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2680/trainer_state.json @@ -0,0 +1,2848 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.667496886674969, + "eval_steps": 20, + "global_step": 2680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.6436423595865088e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..af3508a2b571bcb48eac3f53ea771b51b10964da --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2700/trainer_state.json @@ -0,0 +1,2869 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.717310087173101, + "eval_steps": 20, + "global_step": 2700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.66178337196501e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..89e4623025da677303f3afe44ad914ae42ec18a6 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2720/trainer_state.json @@ -0,0 +1,2890 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.767123287671232, + "eval_steps": 20, + "global_step": 2720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.679866939150684e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..400932b8647957ba324337ec57fe6f00def4a22f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2740/trainer_state.json @@ -0,0 +1,2911 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.816936488169365, + "eval_steps": 20, + "global_step": 2740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.697999873298944e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..38604771b36d4b5160b60a5db15fe77e60a3b976 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2760/trainer_state.json @@ -0,0 +1,2932 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.866749688667497, + "eval_steps": 20, + "global_step": 2760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.7169352449845043e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1bd7e291ee29a4d111abadb9fca4564e42b2a2cb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2780/trainer_state.json @@ -0,0 +1,2953 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.916562889165629, + "eval_steps": 20, + "global_step": 2780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.7396395598681907e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fb4955a0058e5af3ea5ce66fb0e3e13f04d1023c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-280/trainer_state.json @@ -0,0 +1,328 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6973848069738481, + "eval_steps": 20, + "global_step": 280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.799770988645581e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d819a80384b6cd740b55ef287795692d99d3d81c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2800/trainer_state.json @@ -0,0 +1,2974 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.966376089663761, + "eval_steps": 20, + "global_step": 2800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.7583451507824435e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..851edff653f4c271fc77d03dff0b9400804d4462 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2820/trainer_state.json @@ -0,0 +1,2995 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.01494396014944, + "eval_steps": 20, + "global_step": 2820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.77769206341974e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..48fd7081598b9bc84acb0335d1db4e756c118fd2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2840/trainer_state.json @@ -0,0 +1,3016 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.064757160647572, + "eval_steps": 20, + "global_step": 2840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.7960413146222387e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9235afb7fc3942cd5bacfeefc1172f0681e5a974 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2860/trainer_state.json @@ -0,0 +1,3037 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.114570361145703, + "eval_steps": 20, + "global_step": 2860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.8143420964432896e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6eab8969e6e80a494fec13597b22f2dc7af6e8a3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2880/trainer_state.json @@ -0,0 +1,3058 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.164383561643835, + "eval_steps": 20, + "global_step": 2880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.832412199911895e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ec10d0ccacb70702f638ae6fa23d1f4e06904db9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2900/trainer_state.json @@ -0,0 +1,3079 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.214196762141968, + "eval_steps": 20, + "global_step": 2900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.8524246689629594e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..59752aa45c89b366bfe667de0a6ba217baae0e52 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2920/trainer_state.json @@ -0,0 +1,3100 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.2640099626401, + "eval_steps": 20, + "global_step": 2920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.871313366429348e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..03a87c8182571d67db5030a88c04ee741e2abef7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2940/trainer_state.json @@ -0,0 +1,3121 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.313823163138232, + "eval_steps": 20, + "global_step": 2940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.893204472802079e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..147461c28c09dafcf0d6956228c24af5d8f89a22 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2960/trainer_state.json @@ -0,0 +1,3142 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.363636363636363, + "eval_steps": 20, + "global_step": 2960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.9121676695029146e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e97c3152ee0a9a9947c7ceffc4ac08abc804972e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-2980/trainer_state.json @@ -0,0 +1,3163 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.4134495641344955, + "eval_steps": 20, + "global_step": 2980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.930963916112097e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a4b8914b46536ae633a9225167a1e49f31ad42e4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-300/trainer_state.json @@ -0,0 +1,349 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.7471980074719801, + "eval_steps": 20, + "global_step": 300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.9940793533825024e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e42b8003b589ecb831f900ba8fae4dd20ffad45a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3000/trainer_state.json @@ -0,0 +1,3184 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.463262764632628, + "eval_steps": 20, + "global_step": 3000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.949801451453624e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..827c9477245deb15154ca13769edf7d2f2f06a4e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3020/trainer_state.json @@ -0,0 +1,3205 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.51307596513076, + "eval_steps": 20, + "global_step": 3020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.9698489261690675e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6a3b7597d5e4abfe3f65724b3a535a7f95e25a22 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3040/trainer_state.json @@ -0,0 +1,3226 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.562889165628892, + "eval_steps": 20, + "global_step": 3040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.9910336361862554e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aad111d71e63fd28a3c64dc820fede630a6ea9aa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3060/trainer_state.json @@ -0,0 +1,3247 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.6127023661270234, + "eval_steps": 20, + "global_step": 3060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.0119894630132736e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..cb7d01f33862000597b365c272498ea1ae7b7fa3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3080/trainer_state.json @@ -0,0 +1,3268 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.662515566625156, + "eval_steps": 20, + "global_step": 3080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.0323304467608166e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..49847ab6569e8c96e7427ad867a90a238260e93e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3100/trainer_state.json @@ -0,0 +1,3289 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.712328767123288, + "eval_steps": 20, + "global_step": 3100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.05284825399253e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..144c6b8868b24330ef04aa24aae31f60f05e04b4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3120/trainer_state.json @@ -0,0 +1,3310 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.76214196762142, + "eval_steps": 20, + "global_step": 3120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.073369651548795e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6c39ce1c8e08f0d4035304829c675692dcd6a86c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3140/trainer_state.json @@ -0,0 +1,3331 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.811955168119551, + "eval_steps": 20, + "global_step": 3140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.0946369390306714e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..87bcc17fc76a7c3a9c11e3c6724a7f20c31c112e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3160/trainer_state.json @@ -0,0 +1,3352 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.861768368617684, + "eval_steps": 20, + "global_step": 3160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.1162318436278886e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3b89d9064479a4796df0119d2047faf327a409a7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3180/trainer_state.json @@ -0,0 +1,3373 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.911581569115816, + "eval_steps": 20, + "global_step": 3180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.135096306403553e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a7bca837875a8303ab6226c26c03195494af8924 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-320/trainer_state.json @@ -0,0 +1,370 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.797011207970112, + "eval_steps": 20, + "global_step": 320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.1957299318276096e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5c364a0b7a98e6300c995cc8e5240721b8d4d298 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3200/trainer_state.json @@ -0,0 +1,3394 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.961394769613948, + "eval_steps": 20, + "global_step": 3200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.154914897928827e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3f1c94b2e7e14e65ffaefacc51eed8bdeac9d2f6 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3220/trainer_state.json @@ -0,0 +1,3415 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.009962640099626, + "eval_steps": 20, + "global_step": 3220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.174483737502474e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..761de819c6536233346326d967c160cc7303edc3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3240/trainer_state.json @@ -0,0 +1,3436 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.059775840597759, + "eval_steps": 20, + "global_step": 3240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.194323870975058e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0c95c557a15b564259237f7ffbbd9200c59ea048 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3260/trainer_state.json @@ -0,0 +1,3457 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.10958904109589, + "eval_steps": 20, + "global_step": 3260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.213645202549924e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6986b2190e0607614059fa0c753f359d545ed319 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3280/trainer_state.json @@ -0,0 +1,3478 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.159402241594023, + "eval_steps": 20, + "global_step": 3280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.234219557393326e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..77dd688f961b0f043abfbdeed1def848a33f815b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3300/trainer_state.json @@ -0,0 +1,3499 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.209215442092155, + "eval_steps": 20, + "global_step": 3300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.2547032565417984e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..05623ef01e4154d474e1dcf0d230602d75fdcffd --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3320/trainer_state.json @@ -0,0 +1,3520 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.259028642590286, + "eval_steps": 20, + "global_step": 3320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.27353450881536e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..04877e76fd7e5e9a1d3900cc9d0895ca76529ff3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3340/trainer_state.json @@ -0,0 +1,3541 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.308841843088418, + "eval_steps": 20, + "global_step": 3340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.2929608573833626e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..af63826af1896a997e7fa614fa53b85dd79910fa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3360/trainer_state.json @@ -0,0 +1,3562 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.35865504358655, + "eval_steps": 20, + "global_step": 3360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.3125074818238464e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8808cce1ae7e5a9c9f59b72dcc43d8dda86a8d04 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3380/trainer_state.json @@ -0,0 +1,3583 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.408468244084682, + "eval_steps": 20, + "global_step": 3380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.3308271128487936e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a8a8f92f6eddb0fe285536241053a4a23d6163ca --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-340/trainer_state.json @@ -0,0 +1,391 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8468244084682441, + "eval_steps": 20, + "global_step": 340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.3829115023294464e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4112a2ec690054c3c131718081235194998057f9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3400/trainer_state.json @@ -0,0 +1,3604 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.458281444582815, + "eval_steps": 20, + "global_step": 3400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.350161908140728e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e2152e81aae17968b55755ff5a5b617ea7897765 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3420/trainer_state.json @@ -0,0 +1,3625 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.508094645080947, + "eval_steps": 20, + "global_step": 3420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.369516450217697e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..83594e71c2103cc4968946d06831167f43be7d04 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3440/trainer_state.json @@ -0,0 +1,3646 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.557907845579079, + "eval_steps": 20, + "global_step": 3440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.389398770003763e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..57cbd5d785876f9a12926146442ff62154971a39 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3460/trainer_state.json @@ -0,0 +1,3667 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.607721046077211, + "eval_steps": 20, + "global_step": 3460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4093681551602074e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e6dd8d013bab7f63832588a30eed9d38d9a157aa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3480/trainer_state.json @@ -0,0 +1,3688 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.657534246575342, + "eval_steps": 20, + "global_step": 3480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4298419809161626e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aabab89f948543b9945b39a0f9f4d7e33f04ee12 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3500/trainer_state.json @@ -0,0 +1,3709 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.707347447073474, + "eval_steps": 20, + "global_step": 3500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4516307630391706e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b258e6571beae878310869d2b027e68ff51f205f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3520/trainer_state.json @@ -0,0 +1,3730 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.757160647571606, + "eval_steps": 20, + "global_step": 3520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.471473589255168e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..35e83c5ed6451f9eb6ad90860f1f6c86866a7ae4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3540/trainer_state.json @@ -0,0 +1,3751 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.806973848069738, + "eval_steps": 20, + "global_step": 3540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4923127305342566e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f81c1b98940247ba821ded9d65d335eb676a6a0a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3560/trainer_state.json @@ -0,0 +1,3772 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.85678704856787, + "eval_steps": 20, + "global_step": 3560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.509752732044042e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dcac14be3b866e8d5d0cb61348ad6bfb874260fd --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3580/trainer_state.json @@ -0,0 +1,3793 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.906600249066003, + "eval_steps": 20, + "global_step": 3580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.527526633737134e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fdf64e805e40024bb38a1a7e5d5ee501e4bdd63e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-360/trainer_state.json @@ -0,0 +1,412 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8966376089663761, + "eval_steps": 20, + "global_step": 360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5892743817486336e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..36ba38c374ac1c9b10cacc78177538b0919dda1d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3600/trainer_state.json @@ -0,0 +1,3814 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.956413449564135, + "eval_steps": 20, + "global_step": 3600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5487499397432525e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e78ec1ae5aa237447b8dfdfdb7dad68f31e7b46e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3620/trainer_state.json @@ -0,0 +1,3835 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.004981320049813, + "eval_steps": 20, + "global_step": 3620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5680073186620416e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ab57a59e2462b5fdd37d52988516edeac6a737d2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3640/trainer_state.json @@ -0,0 +1,3856 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.054794520547945, + "eval_steps": 20, + "global_step": 3640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.586990262147912e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6c64b3a265a5f94e68edb5ba587653a5f6cd7b51 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3660/trainer_state.json @@ -0,0 +1,3877 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.104607721046078, + "eval_steps": 20, + "global_step": 3660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.607405745129902e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bc17e4c26328cb0712a3a4cdba3ce366517964f8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3680/trainer_state.json @@ -0,0 +1,3898 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.15442092154421, + "eval_steps": 20, + "global_step": 3680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.626792600127836e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..78f950540f8a2505d5ad189e04c0ef7ffc111293 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3700/trainer_state.json @@ -0,0 +1,3919 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.204234122042342, + "eval_steps": 20, + "global_step": 3700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6481290013573325e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2bb5fcaf47d68e20f6c6b2f88a61ffb96c50bb4c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3720/trainer_state.json @@ -0,0 +1,3940 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.254047322540472, + "eval_steps": 20, + "global_step": 3720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6676630596618854e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b38a24a2273be771825ae5e1b4d8b0c3cfcea025 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3740/trainer_state.json @@ -0,0 +1,3961 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.303860523038605, + "eval_steps": 20, + "global_step": 3740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.686834495186719e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f800e5fc75df3ca79a1aa95095cb247242f2828b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3760/trainer_state.json @@ -0,0 +1,3982 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.353673723536737, + "eval_steps": 20, + "global_step": 3760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.7059314314771046e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2d336b6f7c37a357422dfe7bad46305c35a24daf --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3780/trainer_state.json @@ -0,0 +1,4003 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.403486924034869, + "eval_steps": 20, + "global_step": 3780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.725921460999721e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..452334fbe7fa7da816637ac53ecd6c7f0aa4e466 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-380/trainer_state.json @@ -0,0 +1,433 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9464508094645081, + "eval_steps": 20, + "global_step": 380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.774840306202214e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..67e034590fa2e13daa2e097cd179defcff3b8a92 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3800/trainer_state.json @@ -0,0 +1,4024 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.453300124533001, + "eval_steps": 20, + "global_step": 3800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.74812402802731e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ccb4186fbb1d1a499cb6eeb72cfab4f86f15ffec --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3820/trainer_state.json @@ -0,0 +1,4045 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.503113325031133, + "eval_steps": 20, + "global_step": 3820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.767130308622766e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5351f8b077de2234f95516953e85d1c747e465e0 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3840/trainer_state.json @@ -0,0 +1,4066 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.552926525529266, + "eval_steps": 20, + "global_step": 3840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.785028076512891e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..81668befdd25e4d25e6ed4b3f3a541d4ea1fd6e7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3860/trainer_state.json @@ -0,0 +1,4087 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.602739726027398, + "eval_steps": 20, + "global_step": 3860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.804764090573476e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a190fdf03b113f2fe33b9dc336533aae3e620bc4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3880/trainer_state.json @@ -0,0 +1,4108 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.65255292652553, + "eval_steps": 20, + "global_step": 3880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8251104598078464e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..16383b4822b85c40feea8f95bb719ae9b112fe62 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3900/trainer_state.json @@ -0,0 +1,4129 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.70236612702366, + "eval_steps": 20, + "global_step": 3900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.845510683910492e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..80e3543981e81a431ac9507e73b44fdc087bbe5f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3920/trainer_state.json @@ -0,0 +1,4150 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.752179327521793, + "eval_steps": 20, + "global_step": 3920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8652538786201805e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f85138e8f2c697d61b8933db0d32daf50516b13d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3940/trainer_state.json @@ -0,0 +1,4171 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.801992528019925, + "eval_steps": 20, + "global_step": 3940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + }, + { + "entropy": 0.11190549619495868, + "epoch": 9.801992528019925, + "grad_norm": 0.2091812938451767, + "learning_rate": 2.491627825638833e-07, + "loss": 0.060925132036209105, + "mean_token_accuracy": 0.9769984439015389, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.221953320468581, + "eval_loss": 0.9476391077041626, + "eval_mean_token_accuracy": 0.854084026328353, + "eval_num_tokens": 9199382.0, + "eval_runtime": 86.0341, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 1.999, + "step": 3940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.884385820574945e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d6fdfe868db1ea7d7f6b816c6fbf530863fc9bef --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3960/trainer_state.json @@ -0,0 +1,4192 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.851805728518057, + "eval_steps": 20, + "global_step": 3960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + }, + { + "entropy": 0.11190549619495868, + "epoch": 9.801992528019925, + "grad_norm": 0.2091812938451767, + "learning_rate": 2.491627825638833e-07, + "loss": 0.060925132036209105, + "mean_token_accuracy": 0.9769984439015389, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.221953320468581, + "eval_loss": 0.9476391077041626, + "eval_mean_token_accuracy": 0.854084026328353, + "eval_num_tokens": 9199382.0, + "eval_runtime": 86.0341, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 1.999, + "step": 3940 + }, + { + "entropy": 0.10218957955949008, + "epoch": 9.851805728518057, + "grad_norm": 0.12602899968624115, + "learning_rate": 1.4133518978026882e-07, + "loss": 0.053277283906936646, + "mean_token_accuracy": 0.9792918466031552, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.22203073113463645, + "eval_loss": 0.9477459192276001, + "eval_mean_token_accuracy": 0.8541027304044989, + "eval_num_tokens": 9251912.0, + "eval_runtime": 86.6774, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.906717639286395e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..244901df63e44c7a6694193e54733a025d650fe8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-3980/trainer_state.json @@ -0,0 +1,4213 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.90161892901619, + "eval_steps": 20, + "global_step": 3980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + }, + { + "entropy": 0.11190549619495868, + "epoch": 9.801992528019925, + "grad_norm": 0.2091812938451767, + "learning_rate": 2.491627825638833e-07, + "loss": 0.060925132036209105, + "mean_token_accuracy": 0.9769984439015389, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.221953320468581, + "eval_loss": 0.9476391077041626, + "eval_mean_token_accuracy": 0.854084026328353, + "eval_num_tokens": 9199382.0, + "eval_runtime": 86.0341, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 1.999, + "step": 3940 + }, + { + "entropy": 0.10218957955949008, + "epoch": 9.851805728518057, + "grad_norm": 0.12602899968624115, + "learning_rate": 1.4133518978026882e-07, + "loss": 0.053277283906936646, + "mean_token_accuracy": 0.9792918466031552, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.22203073113463645, + "eval_loss": 0.9477459192276001, + "eval_mean_token_accuracy": 0.8541027304044989, + "eval_num_tokens": 9251912.0, + "eval_runtime": 86.6774, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3960 + }, + { + "entropy": 0.11482724891975522, + "epoch": 9.90161892901619, + "grad_norm": 0.1705685257911682, + "learning_rate": 6.38578097204261e-08, + "loss": 0.061809581518173215, + "mean_token_accuracy": 0.9767013140022754, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.22197876593401267, + "eval_loss": 0.947809636592865, + "eval_mean_token_accuracy": 0.8540589556444523, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.9626, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 3980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9249780299562394e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b89a140e225d5964b2466eff7541b6f6b91c3ab9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-40/trainer_state.json @@ -0,0 +1,76 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.099626400996264, + "eval_steps": 20, + "global_step": 40, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3753325286326272.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2365c0d10997c131ebd642452b4239087e0d4f8d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-400/trainer_state.json @@ -0,0 +1,454 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9962640099626401, + "eval_steps": 20, + "global_step": 400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.964974918647808e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ae6ecebe96ebba4203052bf655333d9261a9bd80 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4000/trainer_state.json @@ -0,0 +1,4234 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.951432129514322, + "eval_steps": 20, + "global_step": 4000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + }, + { + "entropy": 0.11190549619495868, + "epoch": 9.801992528019925, + "grad_norm": 0.2091812938451767, + "learning_rate": 2.491627825638833e-07, + "loss": 0.060925132036209105, + "mean_token_accuracy": 0.9769984439015389, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.221953320468581, + "eval_loss": 0.9476391077041626, + "eval_mean_token_accuracy": 0.854084026328353, + "eval_num_tokens": 9199382.0, + "eval_runtime": 86.0341, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 1.999, + "step": 3940 + }, + { + "entropy": 0.10218957955949008, + "epoch": 9.851805728518057, + "grad_norm": 0.12602899968624115, + "learning_rate": 1.4133518978026882e-07, + "loss": 0.053277283906936646, + "mean_token_accuracy": 0.9792918466031552, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.22203073113463645, + "eval_loss": 0.9477459192276001, + "eval_mean_token_accuracy": 0.8541027304044989, + "eval_num_tokens": 9251912.0, + "eval_runtime": 86.6774, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3960 + }, + { + "entropy": 0.11482724891975522, + "epoch": 9.90161892901619, + "grad_norm": 0.1705685257911682, + "learning_rate": 6.38578097204261e-08, + "loss": 0.061809581518173215, + "mean_token_accuracy": 0.9767013140022754, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.22197876593401267, + "eval_loss": 0.947809636592865, + "eval_mean_token_accuracy": 0.8540589556444523, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.9626, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 3980 + }, + { + "entropy": 0.1206501518841833, + "epoch": 9.951432129514322, + "grad_norm": 0.17280042171478271, + "learning_rate": 1.675400850544711e-08, + "loss": 0.06324169635772706, + "mean_token_accuracy": 0.9753918401896954, + "num_tokens": 9341118.0, + "step": 4000 + }, + { + "epoch": 9.951432129514322, + "eval_entropy": 0.22201869714745257, + "eval_loss": 0.9477588534355164, + "eval_mean_token_accuracy": 0.8541659501402877, + "eval_num_tokens": 9341118.0, + "eval_runtime": 86.6633, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 4000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9449716498034074e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..43b44e849978a49365c74c5621bf6b8058795330 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-4020/trainer_state.json @@ -0,0 +1,4255 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 10.0, + "eval_steps": 20, + "global_step": 4020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + }, + { + "entropy": 0.4727417893707752, + "epoch": 2.488169364881694, + "grad_norm": 0.7852500677108765, + "learning_rate": 0.0001883129646126818, + "loss": 0.4142886161804199, + "mean_token_accuracy": 0.8712429471313954, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5386548059624295, + "eval_loss": 0.536101222038269, + "eval_mean_token_accuracy": 0.8499491239009902, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.9501, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.978, + "step": 1000 + }, + { + "entropy": 0.4673406321555376, + "epoch": 2.5379825653798256, + "grad_norm": 0.7133921384811401, + "learning_rate": 0.0001874326505341286, + "loss": 0.40857529640197754, + "mean_token_accuracy": 0.8747925907373428, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.495788364909416, + "eval_loss": 0.5418923497200012, + "eval_mean_token_accuracy": 0.851321972040243, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.7154, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.983, + "step": 1020 + }, + { + "entropy": 0.47599745728075504, + "epoch": 2.587795765877958, + "grad_norm": 0.8202953338623047, + "learning_rate": 0.0001865262021621137, + "loss": 0.40998234748840334, + "mean_token_accuracy": 0.8758242674171924, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.4887966953737791, + "eval_loss": 0.5408804416656494, + "eval_mean_token_accuracy": 0.8512661065473113, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.7869, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 1040 + }, + { + "entropy": 0.4824396539479494, + "epoch": 2.6376089663760895, + "grad_norm": 0.6507360935211182, + "learning_rate": 0.00018559389286910275, + "loss": 0.4165764808654785, + "mean_token_accuracy": 0.8722914069890976, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.4793398808254752, + "eval_loss": 0.5326959490776062, + "eval_mean_token_accuracy": 0.8534493650807891, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.9559, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1060 + }, + { + "entropy": 0.4605010639876127, + "epoch": 2.6874221668742218, + "grad_norm": 0.6740535497665405, + "learning_rate": 0.00018463600382686253, + "loss": 0.4123940944671631, + "mean_token_accuracy": 0.8733638986945153, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.47902208583992584, + "eval_loss": 0.5372340083122253, + "eval_mean_token_accuracy": 0.851325950303743, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.9638, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 1080 + }, + { + "entropy": 0.4872019402682781, + "epoch": 2.7372353673723535, + "grad_norm": 0.6994742155075073, + "learning_rate": 0.0001836528239216632, + "loss": 0.41599602699279786, + "mean_token_accuracy": 0.872775862365961, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.4893243626453156, + "eval_loss": 0.5327795743942261, + "eval_mean_token_accuracy": 0.8537560302850812, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.823, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.981, + "step": 1100 + }, + { + "entropy": 0.4949610233306885, + "epoch": 2.7870485678704857, + "grad_norm": 0.9605912566184998, + "learning_rate": 0.0001826446496671543, + "loss": 0.4266993045806885, + "mean_token_accuracy": 0.8688005246222019, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5061517927882283, + "eval_loss": 0.5356810092926025, + "eval_mean_token_accuracy": 0.8524593568818514, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.8385, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.981, + "step": 1120 + }, + { + "entropy": 0.48401356525719164, + "epoch": 2.8368617683686175, + "grad_norm": 0.6332499980926514, + "learning_rate": 0.00018161178511494022, + "loss": 0.42131738662719725, + "mean_token_accuracy": 0.8729447312653065, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.48792897060860035, + "eval_loss": 0.5290402173995972, + "eval_mean_token_accuracy": 0.853078076659247, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.7746, + "eval_samples_per_second": 15.857, + "eval_steps_per_second": 1.982, + "step": 1140 + }, + { + "entropy": 0.48017631396651267, + "epoch": 2.8866749688667497, + "grad_norm": 0.8013222217559814, + "learning_rate": 0.00018055454176288234, + "loss": 0.4195223808288574, + "mean_token_accuracy": 0.8721428856253624, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.5205728571082271, + "eval_loss": 0.5242091417312622, + "eval_mean_token_accuracy": 0.8535184077052183, + "eval_num_tokens": 2710196.0, + "eval_runtime": 87.009, + "eval_samples_per_second": 15.814, + "eval_steps_per_second": 1.977, + "step": 1160 + }, + { + "entropy": 0.4914963707327843, + "epoch": 2.936488169364882, + "grad_norm": 0.7638444900512695, + "learning_rate": 0.00017947323846115553, + "loss": 0.42672080993652345, + "mean_token_accuracy": 0.8699039086699486, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5012746392640957, + "eval_loss": 0.523289144039154, + "eval_mean_token_accuracy": 0.8543414289868155, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.939, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.978, + "step": 1180 + }, + { + "entropy": 0.48674912229180334, + "epoch": 2.9863013698630136, + "grad_norm": 0.6185152530670166, + "learning_rate": 0.00017836820131608745, + "loss": 0.4154937744140625, + "mean_token_accuracy": 0.8686325438320637, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.4763167448515116, + "eval_loss": 0.5311836004257202, + "eval_mean_token_accuracy": 0.8521223698937616, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.6775, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 1200 + }, + { + "entropy": 0.40521582922874355, + "epoch": 3.0348692403486925, + "grad_norm": 0.7635012269020081, + "learning_rate": 0.0001772397635918091, + "loss": 0.3426941394805908, + "mean_token_accuracy": 0.8914182109710498, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.444144579733527, + "eval_loss": 0.5566298961639404, + "eval_mean_token_accuracy": 0.8528384368780048, + "eval_num_tokens": 2848509.0, + "eval_runtime": 87.0782, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 1220 + }, + { + "entropy": 0.3624659780412912, + "epoch": 3.0846824408468243, + "grad_norm": 0.7089799046516418, + "learning_rate": 0.000176088265609747, + "loss": 0.29830265045166016, + "mean_token_accuracy": 0.9024251900613308, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.4600461038739182, + "eval_loss": 0.5547332167625427, + "eval_mean_token_accuracy": 0.8523849744436353, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.8998, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1240 + }, + { + "entropy": 0.3730695676058531, + "epoch": 3.1344956413449565, + "grad_norm": 0.850790798664093, + "learning_rate": 0.00017491405464598693, + "loss": 0.30087215900421144, + "mean_token_accuracy": 0.9013829864561558, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.43883725758208786, + "eval_loss": 0.556238055229187, + "eval_mean_token_accuracy": 0.851823707999185, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.6609, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1260 + }, + { + "entropy": 0.3766512680798769, + "epoch": 3.1843088418430883, + "grad_norm": 0.8249748945236206, + "learning_rate": 0.00017371748482654015, + "loss": 0.3063816070556641, + "mean_token_accuracy": 0.9013078331947326, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.455615431763405, + "eval_loss": 0.5655665993690491, + "eval_mean_token_accuracy": 0.8502279263596202, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.9248, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.979, + "step": 1280 + }, + { + "entropy": 0.38341562673449514, + "epoch": 3.2341220423412205, + "grad_norm": 0.7116150856018066, + "learning_rate": 0.0001724989170205438, + "loss": 0.3090095043182373, + "mean_token_accuracy": 0.8975317768752575, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43765638578076693, + "eval_loss": 0.5622899532318115, + "eval_mean_token_accuracy": 0.8535801556914352, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.8191, + "eval_samples_per_second": 15.849, + "eval_steps_per_second": 1.981, + "step": 1300 + }, + { + "entropy": 0.3648845721036196, + "epoch": 3.2839352428393527, + "grad_norm": 2.4296491146087646, + "learning_rate": 0.0001712587187314278, + "loss": 0.30108642578125, + "mean_token_accuracy": 0.9024063929915428, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.47450404683517855, + "eval_loss": 0.5497040152549744, + "eval_mean_token_accuracy": 0.852605615590894, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.8508, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.98, + "step": 1320 + }, + { + "entropy": 0.40571765452623365, + "epoch": 3.3337484433374844, + "grad_norm": 0.8728042244911194, + "learning_rate": 0.00016999726398608065, + "loss": 0.3268932104110718, + "mean_token_accuracy": 0.8947565704584122, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.45309220496998276, + "eval_loss": 0.5505508780479431, + "eval_mean_token_accuracy": 0.8525978032239648, + "eval_num_tokens": 3132874.0, + "eval_runtime": 87.0437, + "eval_samples_per_second": 15.808, + "eval_steps_per_second": 1.976, + "step": 1340 + }, + { + "entropy": 0.39150902144610883, + "epoch": 3.383561643835616, + "grad_norm": 0.9764124155044556, + "learning_rate": 0.00016871493322204826, + "loss": 0.32332139015197753, + "mean_token_accuracy": 0.8968119442462921, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.4515272902194844, + "eval_loss": 0.5608078837394714, + "eval_mean_token_accuracy": 0.8525907397270203, + "eval_num_tokens": 3178055.0, + "eval_runtime": 87.1423, + "eval_samples_per_second": 15.79, + "eval_steps_per_second": 1.974, + "step": 1360 + }, + { + "entropy": 0.39573758877813814, + "epoch": 3.4333748443337484, + "grad_norm": 0.7583338618278503, + "learning_rate": 0.00016741211317279893, + "loss": 0.3187565803527832, + "mean_token_accuracy": 0.8971615083515644, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.4382614852037541, + "eval_loss": 0.5680410861968994, + "eval_mean_token_accuracy": 0.851775293433389, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.9039, + "eval_samples_per_second": 15.834, + "eval_steps_per_second": 1.979, + "step": 1380 + }, + { + "entropy": 0.38341186530888083, + "epoch": 3.4831880448318806, + "grad_norm": 0.8511857986450195, + "learning_rate": 0.00016608919675108996, + "loss": 0.31606297492980956, + "mean_token_accuracy": 0.8974148526787757, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.42544752082159354, + "eval_loss": 0.5536707639694214, + "eval_mean_token_accuracy": 0.854495684074801, + "eval_num_tokens": 3274096.0, + "eval_runtime": 87.0017, + "eval_samples_per_second": 15.816, + "eval_steps_per_second": 1.977, + "step": 1400 + }, + { + "entropy": 0.3771478392183781, + "epoch": 3.5330012453300124, + "grad_norm": 0.8417750000953674, + "learning_rate": 0.0001647465829304705, + "loss": 0.3137716054916382, + "mean_token_accuracy": 0.900364401191473, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4379603945931723, + "eval_loss": 0.5532916784286499, + "eval_mean_token_accuracy": 0.8527980658204056, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.9545, + "eval_samples_per_second": 15.824, + "eval_steps_per_second": 1.978, + "step": 1420 + }, + { + "entropy": 0.39049469511955975, + "epoch": 3.5828144458281446, + "grad_norm": 0.7178560495376587, + "learning_rate": 0.0001633846766249565, + "loss": 0.32054433822631834, + "mean_token_accuracy": 0.8984041027724743, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.44776528259349424, + "eval_loss": 0.5596351027488708, + "eval_mean_token_accuracy": 0.8523151042849518, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.6601, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 1440 + }, + { + "entropy": 0.3994994066655636, + "epoch": 3.6326276463262763, + "grad_norm": 0.6914435625076294, + "learning_rate": 0.00016200388856691433, + "loss": 0.32937595844268797, + "mean_token_accuracy": 0.893961051106453, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.4416292599120805, + "eval_loss": 0.5500746965408325, + "eval_mean_token_accuracy": 0.852156569444856, + "eval_num_tokens": 3415600.0, + "eval_runtime": 87.1683, + "eval_samples_per_second": 15.786, + "eval_steps_per_second": 1.973, + "step": 1460 + }, + { + "entropy": 0.40447953082621096, + "epoch": 3.6824408468244085, + "grad_norm": 0.669640839099884, + "learning_rate": 0.00016060463518318926, + "loss": 0.32666375637054446, + "mean_token_accuracy": 0.8955025888979435, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.44157897559709325, + "eval_loss": 0.555138111114502, + "eval_mean_token_accuracy": 0.8522906923709914, + "eval_num_tokens": 3460471.0, + "eval_runtime": 87.3983, + "eval_samples_per_second": 15.744, + "eval_steps_per_second": 1.968, + "step": 1480 + }, + { + "entropy": 0.3910129055380821, + "epoch": 3.7322540473225407, + "grad_norm": 0.6813255548477173, + "learning_rate": 0.00015918733846951693, + "loss": 0.3226655960083008, + "mean_token_accuracy": 0.8959677331149578, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4205027032037114, + "eval_loss": 0.5615105628967285, + "eval_mean_token_accuracy": 0.852928082263747, + "eval_num_tokens": 3507647.0, + "eval_runtime": 87.1162, + "eval_samples_per_second": 15.795, + "eval_steps_per_second": 1.974, + "step": 1500 + }, + { + "entropy": 0.3978020466864109, + "epoch": 3.7820672478206725, + "grad_norm": 0.7461448907852173, + "learning_rate": 0.00015775242586325538, + "loss": 0.33161282539367676, + "mean_token_accuracy": 0.8929055534303189, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.42685241338818575, + "eval_loss": 0.558264970779419, + "eval_mean_token_accuracy": 0.8518715078054473, + "eval_num_tokens": 3548934.0, + "eval_runtime": 87.1858, + "eval_samples_per_second": 15.782, + "eval_steps_per_second": 1.973, + "step": 1520 + }, + { + "entropy": 0.38580134473741057, + "epoch": 3.8318804483188043, + "grad_norm": 0.8667106032371521, + "learning_rate": 0.00015630033011447534, + "loss": 0.3317128896713257, + "mean_token_accuracy": 0.8927417695522308, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.44643741187661196, + "eval_loss": 0.5528179407119751, + "eval_mean_token_accuracy": 0.8526672790216845, + "eval_num_tokens": 3597186.0, + "eval_runtime": 87.1379, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.974, + "step": 1540 + }, + { + "entropy": 0.38523379489779475, + "epoch": 3.8816936488169365, + "grad_norm": 1.001920461654663, + "learning_rate": 0.0001548314891554491, + "loss": 0.3263416051864624, + "mean_token_accuracy": 0.8965372897684574, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4217506472107976, + "eval_loss": 0.5582898855209351, + "eval_mean_token_accuracy": 0.8525883361350658, + "eval_num_tokens": 3646646.0, + "eval_runtime": 87.177, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.973, + "step": 1560 + }, + { + "entropy": 0.39575362466275693, + "epoch": 3.9315068493150687, + "grad_norm": 0.7755498290061951, + "learning_rate": 0.00015334634596857598, + "loss": 0.32946195602416994, + "mean_token_accuracy": 0.8922067232429981, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.44022568661806194, + "eval_loss": 0.5536255240440369, + "eval_mean_token_accuracy": 0.853287082078845, + "eval_num_tokens": 3689560.0, + "eval_runtime": 87.0747, + "eval_samples_per_second": 15.803, + "eval_steps_per_second": 1.975, + "step": 1580 + }, + { + "entropy": 0.38972948826849463, + "epoch": 3.9813200498132004, + "grad_norm": 0.9432196617126465, + "learning_rate": 0.0001518453484527848, + "loss": 0.3292489767074585, + "mean_token_accuracy": 0.8934461928904056, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.43847283859585606, + "eval_loss": 0.5473363995552063, + "eval_mean_token_accuracy": 0.853469139268232, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.8446, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.981, + "step": 1600 + }, + { + "entropy": 0.3139461097426904, + "epoch": 4.029887920298879, + "grad_norm": 0.9580853581428528, + "learning_rate": 0.00015032894928845378, + "loss": 0.2577517986297607, + "mean_token_accuracy": 0.9184213326527522, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.36030947936828744, + "eval_loss": 0.6320357322692871, + "eval_mean_token_accuracy": 0.8514543522235959, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.4872, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1620 + }, + { + "entropy": 0.283712088316679, + "epoch": 4.0797011207970115, + "grad_norm": 0.6759635210037231, + "learning_rate": 0.00014879760580088826, + "loss": 0.21372199058532715, + "mean_token_accuracy": 0.9291425101459027, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.3795742853436359, + "eval_loss": 0.6112104654312134, + "eval_mean_token_accuracy": 0.8501740534638249, + "eval_num_tokens": 3828830.0, + "eval_runtime": 86.7132, + "eval_samples_per_second": 15.868, + "eval_steps_per_second": 1.984, + "step": 1640 + }, + { + "entropy": 0.2836189458146691, + "epoch": 4.129514321295143, + "grad_norm": 0.6797131299972534, + "learning_rate": 0.00014725177982239767, + "loss": 0.21063549518585206, + "mean_token_accuracy": 0.9303271003067494, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.38122218240832173, + "eval_loss": 0.6002676486968994, + "eval_mean_token_accuracy": 0.8516882522854694, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.7816, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 1660 + }, + { + "entropy": 0.2938332514837384, + "epoch": 4.179327521793275, + "grad_norm": 2.0500826835632324, + "learning_rate": 0.00014569193755301305, + "loss": 0.2256624460220337, + "mean_token_accuracy": 0.9247965328395367, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.38222643785005395, + "eval_loss": 0.6075488924980164, + "eval_mean_token_accuracy": 0.8500458916952444, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7462, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.983, + "step": 1680 + }, + { + "entropy": 0.2907615687698126, + "epoch": 4.229140722291407, + "grad_norm": 0.6996814608573914, + "learning_rate": 0.00014411854941988772, + "loss": 0.2183893918991089, + "mean_token_accuracy": 0.9268265649676323, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3791500868838887, + "eval_loss": 0.6009940505027771, + "eval_mean_token_accuracy": 0.8522552584492883, + "eval_num_tokens": 3967474.0, + "eval_runtime": 86.6182, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 1700 + }, + { + "entropy": 0.2931097410619259, + "epoch": 4.2789539227895395, + "grad_norm": 1.047773003578186, + "learning_rate": 0.00014253208993542275, + "loss": 0.22391772270202637, + "mean_token_accuracy": 0.9256755143404007, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3881096559208493, + "eval_loss": 0.6058024764060974, + "eval_mean_token_accuracy": 0.8516207212625548, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7613, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.2862068932503462, + "epoch": 4.328767123287671, + "grad_norm": 0.7637642025947571, + "learning_rate": 0.00014093303755416048, + "loss": 0.21297969818115234, + "mean_token_accuracy": 0.9277966007590294, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.3942466052465661, + "eval_loss": 0.596074104309082, + "eval_mean_token_accuracy": 0.8516605569179668, + "eval_num_tokens": 4062594.0, + "eval_runtime": 86.4379, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 1740 + }, + { + "entropy": 0.28564709294587376, + "epoch": 4.378580323785803, + "grad_norm": 0.9261002540588379, + "learning_rate": 0.00013932187452848907, + "loss": 0.21695659160614014, + "mean_token_accuracy": 0.9291524566709995, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38845692921516506, + "eval_loss": 0.6026391983032227, + "eval_mean_token_accuracy": 0.8520834189514781, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6486, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.29184935465455053, + "epoch": 4.428393524283935, + "grad_norm": 0.8760656714439392, + "learning_rate": 0.00013769908676320198, + "loss": 0.21900837421417235, + "mean_token_accuracy": 0.9270037837326527, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.372284933404867, + "eval_loss": 0.6095370054244995, + "eval_mean_token_accuracy": 0.8511590410110562, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6256, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 1780 + }, + { + "entropy": 0.30764632020145655, + "epoch": 4.478206724782067, + "grad_norm": 0.7438597679138184, + "learning_rate": 0.00013606516366895552, + "loss": 0.23197441101074218, + "mean_token_accuracy": 0.922636279463768, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.37462779758281484, + "eval_loss": 0.6045190691947937, + "eval_mean_token_accuracy": 0.851631471237471, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.457, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 1800 + }, + { + "entropy": 0.3059290213510394, + "epoch": 4.5280199252802, + "grad_norm": 0.7649065852165222, + "learning_rate": 0.00013442059801466934, + "loss": 0.22677943706512452, + "mean_token_accuracy": 0.9249936550855636, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38022891068181325, + "eval_loss": 0.5899756550788879, + "eval_mean_token_accuracy": 0.8530971352444139, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.7306, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 1820 + }, + { + "entropy": 0.30684010963886976, + "epoch": 4.577833125778331, + "grad_norm": 0.6305304169654846, + "learning_rate": 0.00013276588577891408, + "loss": 0.2301240921020508, + "mean_token_accuracy": 0.9220072351396084, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.3938776440052099, + "eval_loss": 0.6018155813217163, + "eval_mean_token_accuracy": 0.8511968948120294, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.5261, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 1840 + }, + { + "entropy": 0.29356779605150224, + "epoch": 4.627646326276463, + "grad_norm": 0.8183266520500183, + "learning_rate": 0.00013110152600033086, + "loss": 0.2146066188812256, + "mean_token_accuracy": 0.9264136716723442, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.3670051993672238, + "eval_loss": 0.6133230924606323, + "eval_mean_token_accuracy": 0.8523070160732713, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 1860 + }, + { + "entropy": 0.30114926025271416, + "epoch": 4.677459526774595, + "grad_norm": 0.7963266372680664, + "learning_rate": 0.00012942802062712827, + "loss": 0.2227048397064209, + "mean_token_accuracy": 0.9253233529627323, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3668888188725294, + "eval_loss": 0.6080331802368164, + "eval_mean_token_accuracy": 0.8522803031427916, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.3427, + "eval_samples_per_second": 15.937, + "eval_steps_per_second": 1.992, + "step": 1880 + }, + { + "entropy": 0.28620288632810115, + "epoch": 4.7272727272727275, + "grad_norm": 0.7326540350914001, + "learning_rate": 0.00012774587436570141, + "loss": 0.22060327529907225, + "mean_token_accuracy": 0.9244944386184215, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.37579410852387896, + "eval_loss": 0.6031104922294617, + "eval_mean_token_accuracy": 0.8523658891749937, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.8475, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.98, + "step": 1900 + }, + { + "entropy": 0.28584762532263996, + "epoch": 4.777085927770859, + "grad_norm": 0.6692739725112915, + "learning_rate": 0.00012605559452841941, + "loss": 0.21919701099395753, + "mean_token_accuracy": 0.9259095810353756, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.37441086370584575, + "eval_loss": 0.6009562611579895, + "eval_mean_token_accuracy": 0.8537772048351376, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.2697, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 1920 + }, + { + "entropy": 0.29914836324751376, + "epoch": 4.826899128268991, + "grad_norm": 0.8272984027862549, + "learning_rate": 0.00012435769088062695, + "loss": 0.22298691272735596, + "mean_token_accuracy": 0.9242447756230832, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.37800539978021797, + "eval_loss": 0.5983167886734009, + "eval_mean_token_accuracy": 0.8530133397773255, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 1940 + }, + { + "entropy": 0.2881341265514493, + "epoch": 4.876712328767123, + "grad_norm": 0.8062415719032288, + "learning_rate": 0.00012265267548690605, + "loss": 0.21832451820373536, + "mean_token_accuracy": 0.9265582844614982, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.3779863022094549, + "eval_loss": 0.5953031182289124, + "eval_mean_token_accuracy": 0.8528582415608472, + "eval_num_tokens": 4578167.0, + "eval_runtime": 86.392, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 1960 + }, + { + "entropy": 0.2998375216498971, + "epoch": 4.926525529265255, + "grad_norm": 0.8576586246490479, + "learning_rate": 0.00012094106255664416, + "loss": 0.22655115127563477, + "mean_token_accuracy": 0.9237113893032074, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.3843588234726773, + "eval_loss": 0.5902820825576782, + "eval_mean_token_accuracy": 0.8534285481586013, + "eval_num_tokens": 4622316.0, + "eval_runtime": 86.5134, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 1980 + }, + { + "entropy": 0.2909785840660334, + "epoch": 4.976338729763388, + "grad_norm": 0.8082723021507263, + "learning_rate": 0.00011922336828895588, + "loss": 0.22233073711395263, + "mean_token_accuracy": 0.9257373474538326, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.3669646157081737, + "eval_loss": 0.6064407229423523, + "eval_mean_token_accuracy": 0.8520209352637447, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.3523, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.992, + "step": 2000 + }, + { + "entropy": 0.2623713301160397, + "epoch": 5.024906600249066, + "grad_norm": 0.7109001874923706, + "learning_rate": 0.00011750011071700422, + "loss": 0.18533332347869874, + "mean_token_accuracy": 0.9396057151831113, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.32857280068619305, + "eval_loss": 0.67312091588974, + "eval_mean_token_accuracy": 0.851016377640325, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.7326, + "eval_samples_per_second": 15.865, + "eval_steps_per_second": 1.983, + "step": 2020 + }, + { + "entropy": 0.1995823234319687, + "epoch": 5.074719800747198, + "grad_norm": 0.7890192270278931, + "learning_rate": 0.00011577180955176883, + "loss": 0.13584012985229493, + "mean_token_accuracy": 0.9562988370656967, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.34224537690711576, + "eval_loss": 0.6417204141616821, + "eval_mean_token_accuracy": 0.8505163937807083, + "eval_num_tokens": 4763269.0, + "eval_runtime": 87.0157, + "eval_samples_per_second": 15.813, + "eval_steps_per_second": 1.977, + "step": 2040 + }, + { + "entropy": 0.19570088442414998, + "epoch": 5.12453300124533, + "grad_norm": 0.7778685688972473, + "learning_rate": 0.00011403898602530831, + "loss": 0.13429765701293944, + "mean_token_accuracy": 0.9550560437142849, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.32213093167127566, + "eval_loss": 0.6681181788444519, + "eval_mean_token_accuracy": 0.8512208888003993, + "eval_num_tokens": 4809047.0, + "eval_runtime": 87.0793, + "eval_samples_per_second": 15.802, + "eval_steps_per_second": 1.975, + "step": 2060 + }, + { + "entropy": 0.19016577154397965, + "epoch": 5.174346201743462, + "grad_norm": 0.7051737904548645, + "learning_rate": 0.00011230216273356379, + "loss": 0.1268880009651184, + "mean_token_accuracy": 0.9573852688074111, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.3113570500944936, + "eval_loss": 0.6709703207015991, + "eval_mean_token_accuracy": 0.8516059614891229, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.1197, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 1.997, + "step": 2080 + }, + { + "entropy": 0.20261877700686454, + "epoch": 5.224159402241594, + "grad_norm": 0.865691065788269, + "learning_rate": 0.00011056186347875099, + "loss": 0.13354524374008178, + "mean_token_accuracy": 0.9550505176186561, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.3161145485071249, + "eval_loss": 0.6627876162528992, + "eval_mean_token_accuracy": 0.8524294512909513, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.8299, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.981, + "step": 2100 + }, + { + "entropy": 0.19859553650021552, + "epoch": 5.273972602739726, + "grad_norm": 0.6281663775444031, + "learning_rate": 0.00010881861311138865, + "loss": 0.13732362985610963, + "mean_token_accuracy": 0.9553415283560753, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.30717471813739733, + "eval_loss": 0.6802853345870972, + "eval_mean_token_accuracy": 0.8511287407126538, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.5104, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2120 + }, + { + "entropy": 0.20874214079231024, + "epoch": 5.323785803237858, + "grad_norm": 0.8394920229911804, + "learning_rate": 0.00010707293737201094, + "loss": 0.13803558349609374, + "mean_token_accuracy": 0.9537043467164039, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3247084985812043, + "eval_loss": 0.6728973984718323, + "eval_mean_token_accuracy": 0.850993697033372, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.8565, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.98, + "step": 2140 + }, + { + "entropy": 0.20558980405330657, + "epoch": 5.37359900373599, + "grad_norm": 1.012776494026184, + "learning_rate": 0.00010532536273261094, + "loss": 0.14250640869140624, + "mean_token_accuracy": 0.9515879444777966, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.33171969920743344, + "eval_loss": 0.6596540212631226, + "eval_mean_token_accuracy": 0.8504481239374294, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.8051, + "eval_samples_per_second": 15.852, + "eval_steps_per_second": 1.981, + "step": 2160 + }, + { + "entropy": 0.2098731081932783, + "epoch": 5.423412204234122, + "grad_norm": 0.69140625, + "learning_rate": 0.00010357641623786434, + "loss": 0.13743176460266113, + "mean_token_accuracy": 0.9536496847867966, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.31884251110428985, + "eval_loss": 0.6732954382896423, + "eval_mean_token_accuracy": 0.8506354866332786, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.8776, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.98, + "step": 2180 + }, + { + "entropy": 0.19826202262192966, + "epoch": 5.473225404732254, + "grad_norm": 0.6710811853408813, + "learning_rate": 0.00010182662534617945, + "loss": 0.13435200452804566, + "mean_token_accuracy": 0.9536436356604099, + "num_tokens": 5135109.0, + "step": 2200 + }, + { + "epoch": 5.473225404732254, + "eval_entropy": 0.3216065409225087, + "eval_loss": 0.6816763877868652, + "eval_mean_token_accuracy": 0.8507848818634831, + "eval_num_tokens": 5135109.0, + "eval_runtime": 86.6332, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2200 + }, + { + "entropy": 0.21997068710625173, + "epoch": 5.523038605230386, + "grad_norm": 0.757554292678833, + "learning_rate": 0.00010007651777062331, + "loss": 0.14061254262924194, + "mean_token_accuracy": 0.9530755899846554, + "num_tokens": 5180138.0, + "step": 2220 + }, + { + "epoch": 5.523038605230386, + "eval_entropy": 0.30639506633891617, + "eval_loss": 0.6736658811569214, + "eval_mean_token_accuracy": 0.8529234050318252, + "eval_num_tokens": 5180138.0, + "eval_runtime": 86.897, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 2220 + }, + { + "entropy": 0.20253944052383305, + "epoch": 5.572851805728518, + "grad_norm": 0.9304871559143066, + "learning_rate": 9.832662131977049e-05, + "loss": 0.1367262840270996, + "mean_token_accuracy": 0.9539065480232238, + "num_tokens": 5226864.0, + "step": 2240 + }, + { + "epoch": 5.572851805728518, + "eval_entropy": 0.3210238650614439, + "eval_loss": 0.6716064214706421, + "eval_mean_token_accuracy": 0.8515368752008261, + "eval_num_tokens": 5226864.0, + "eval_runtime": 86.6072, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 2240 + }, + { + "entropy": 0.204449025914073, + "epoch": 5.62266500622665, + "grad_norm": 0.5895705223083496, + "learning_rate": 9.657746373852313e-05, + "loss": 0.13733654022216796, + "mean_token_accuracy": 0.9532442130148411, + "num_tokens": 5276602.0, + "step": 2260 + }, + { + "epoch": 5.62266500622665, + "eval_entropy": 0.309385709724454, + "eval_loss": 0.6804041266441345, + "eval_mean_token_accuracy": 0.8522362411022186, + "eval_num_tokens": 5276602.0, + "eval_runtime": 86.5785, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 2260 + }, + { + "entropy": 0.1969501075334847, + "epoch": 5.672478206724782, + "grad_norm": 0.6863011121749878, + "learning_rate": 9.482957254895055e-05, + "loss": 0.13382177352905272, + "mean_token_accuracy": 0.9547011263668537, + "num_tokens": 5323718.0, + "step": 2280 + }, + { + "epoch": 5.672478206724782, + "eval_entropy": 0.31496484153145965, + "eval_loss": 0.6663601994514465, + "eval_mean_token_accuracy": 0.8531656691501307, + "eval_num_tokens": 5323718.0, + "eval_runtime": 86.688, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.984, + "step": 2280 + }, + { + "entropy": 0.2036854237318039, + "epoch": 5.722291407222914, + "grad_norm": 0.6446020603179932, + "learning_rate": 9.308347489119546e-05, + "loss": 0.1378130555152893, + "mean_token_accuracy": 0.9532770089805126, + "num_tokens": 5369039.0, + "step": 2300 + }, + { + "epoch": 5.722291407222914, + "eval_entropy": 0.3208180312500444, + "eval_loss": 0.6747905611991882, + "eval_mean_token_accuracy": 0.850395321152931, + "eval_num_tokens": 5369039.0, + "eval_runtime": 86.4375, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.99, + "step": 2300 + }, + { + "entropy": 0.20204954408109188, + "epoch": 5.772104607721046, + "grad_norm": 0.7637709379196167, + "learning_rate": 9.133969736449589e-05, + "loss": 0.13494755029678346, + "mean_token_accuracy": 0.9532943479716778, + "num_tokens": 5417029.0, + "step": 2320 + }, + { + "epoch": 5.772104607721046, + "eval_entropy": 0.3246596093441165, + "eval_loss": 0.6645228862762451, + "eval_mean_token_accuracy": 0.8514835512222245, + "eval_num_tokens": 5417029.0, + "eval_runtime": 86.251, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.994, + "step": 2320 + }, + { + "entropy": 0.21173860989511012, + "epoch": 5.821917808219178, + "grad_norm": 0.8394470810890198, + "learning_rate": 8.959876586837002e-05, + "loss": 0.1376061797142029, + "mean_token_accuracy": 0.9534688055515289, + "num_tokens": 5461671.0, + "step": 2340 + }, + { + "epoch": 5.821917808219178, + "eval_entropy": 0.3140063138548718, + "eval_loss": 0.6684557199478149, + "eval_mean_token_accuracy": 0.8525225107753, + "eval_num_tokens": 5461671.0, + "eval_runtime": 86.4656, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 2340 + }, + { + "entropy": 0.1935113413259387, + "epoch": 5.87173100871731, + "grad_norm": 0.6055243611335754, + "learning_rate": 8.786120544401189e-05, + "loss": 0.1318501591682434, + "mean_token_accuracy": 0.955411896854639, + "num_tokens": 5509312.0, + "step": 2360 + }, + { + "epoch": 5.87173100871731, + "eval_entropy": 0.31226280764784925, + "eval_loss": 0.6752243041992188, + "eval_mean_token_accuracy": 0.8520811529353608, + "eval_num_tokens": 5509312.0, + "eval_runtime": 86.4078, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.991, + "step": 2360 + }, + { + "entropy": 0.2034847954288125, + "epoch": 5.921544209215442, + "grad_norm": 0.6410462260246277, + "learning_rate": 8.612754011594654e-05, + "loss": 0.1375146269798279, + "mean_token_accuracy": 0.9542048372328281, + "num_tokens": 5558196.0, + "step": 2380 + }, + { + "epoch": 5.921544209215442, + "eval_entropy": 0.3186545864960482, + "eval_loss": 0.6681073904037476, + "eval_mean_token_accuracy": 0.851885937674101, + "eval_num_tokens": 5558196.0, + "eval_runtime": 86.4004, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.991, + "step": 2380 + }, + { + "entropy": 0.19530893191695214, + "epoch": 5.971357409713574, + "grad_norm": 0.7243332266807556, + "learning_rate": 8.439829273399083e-05, + "loss": 0.13524004220962524, + "mean_token_accuracy": 0.9542504735291004, + "num_tokens": 5605400.0, + "step": 2400 + }, + { + "epoch": 5.971357409713574, + "eval_entropy": 0.31358762431976406, + "eval_loss": 0.6792373061180115, + "eval_mean_token_accuracy": 0.8525331470855447, + "eval_num_tokens": 5605400.0, + "eval_runtime": 86.4904, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 2400 + }, + { + "entropy": 0.20260333069241965, + "epoch": 6.019925280199253, + "grad_norm": 0.43665260076522827, + "learning_rate": 8.267398481556944e-05, + "loss": 0.1221657395362854, + "mean_token_accuracy": 0.958129896567418, + "num_tokens": 5648968.0, + "step": 2420 + }, + { + "epoch": 6.019925280199253, + "eval_entropy": 0.29224625195181647, + "eval_loss": 0.7269865274429321, + "eval_mean_token_accuracy": 0.8504481551259063, + "eval_num_tokens": 5648968.0, + "eval_runtime": 86.7121, + "eval_samples_per_second": 15.869, + "eval_steps_per_second": 1.984, + "step": 2420 + }, + { + "entropy": 0.1478068961761892, + "epoch": 6.069738480697385, + "grad_norm": 0.5789358019828796, + "learning_rate": 8.095513638843222e-05, + "loss": 0.08725568056106567, + "mean_token_accuracy": 0.9692194186151027, + "num_tokens": 5697633.0, + "step": 2440 + }, + { + "epoch": 6.069738480697385, + "eval_entropy": 0.2874765749587569, + "eval_loss": 0.7498268485069275, + "eval_mean_token_accuracy": 0.8493660684934882, + "eval_num_tokens": 5697633.0, + "eval_runtime": 85.9922, + "eval_samples_per_second": 16.001, + "eval_steps_per_second": 2.0, + "step": 2440 + }, + { + "entropy": 0.1555120893754065, + "epoch": 6.119551681195516, + "grad_norm": 0.4853467643260956, + "learning_rate": 7.924226583382094e-05, + "loss": 0.09054291844367982, + "mean_token_accuracy": 0.9687649801373481, + "num_tokens": 5745090.0, + "step": 2460 + }, + { + "epoch": 6.119551681195516, + "eval_entropy": 0.28221732412659845, + "eval_loss": 0.7451956272125244, + "eval_mean_token_accuracy": 0.8512702442185823, + "eval_num_tokens": 5745090.0, + "eval_runtime": 87.7186, + "eval_samples_per_second": 15.687, + "eval_steps_per_second": 1.961, + "step": 2460 + }, + { + "entropy": 0.15636382224038242, + "epoch": 6.169364881693649, + "grad_norm": 0.484597772359848, + "learning_rate": 7.753588973013247e-05, + "loss": 0.08987976908683777, + "mean_token_accuracy": 0.9688864842057228, + "num_tokens": 5790333.0, + "step": 2480 + }, + { + "epoch": 6.169364881693649, + "eval_entropy": 0.2812082867116429, + "eval_loss": 0.7391297817230225, + "eval_mean_token_accuracy": 0.8511726624050806, + "eval_num_tokens": 5790333.0, + "eval_runtime": 86.2049, + "eval_samples_per_second": 15.962, + "eval_steps_per_second": 1.995, + "step": 2480 + }, + { + "entropy": 0.1488968376070261, + "epoch": 6.219178082191781, + "grad_norm": 0.29219967126846313, + "learning_rate": 7.583652269712595e-05, + "loss": 0.08845279812812805, + "mean_token_accuracy": 0.9708508215844631, + "num_tokens": 5837321.0, + "step": 2500 + }, + { + "epoch": 6.219178082191781, + "eval_entropy": 0.27179383755076764, + "eval_loss": 0.760672390460968, + "eval_mean_token_accuracy": 0.8512875420409579, + "eval_num_tokens": 5837321.0, + "eval_runtime": 86.3888, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.991, + "step": 2500 + }, + { + "entropy": 0.14728794833645226, + "epoch": 6.268991282689913, + "grad_norm": 0.6203164458274841, + "learning_rate": 7.414467724072035e-05, + "loss": 0.08744659423828124, + "mean_token_accuracy": 0.9708136722445488, + "num_tokens": 5884398.0, + "step": 2520 + }, + { + "epoch": 6.268991282689913, + "eval_entropy": 0.2740729117636071, + "eval_loss": 0.7610964179039001, + "eval_mean_token_accuracy": 0.8515192301467408, + "eval_num_tokens": 5884398.0, + "eval_runtime": 86.2266, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 1.995, + "step": 2520 + }, + { + "entropy": 0.15153271816670894, + "epoch": 6.318804483188045, + "grad_norm": 0.5843842625617981, + "learning_rate": 7.246086359842966e-05, + "loss": 0.09105724096298218, + "mean_token_accuracy": 0.9692696832120419, + "num_tokens": 5929876.0, + "step": 2540 + }, + { + "epoch": 6.318804483188045, + "eval_entropy": 0.27398888333592303, + "eval_loss": 0.746191680431366, + "eval_mean_token_accuracy": 0.8532331041818442, + "eval_num_tokens": 5929876.0, + "eval_runtime": 86.2203, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2540 + }, + { + "entropy": 0.14994749650359154, + "epoch": 6.3686176836861765, + "grad_norm": 0.6314879655838013, + "learning_rate": 7.078558958548248e-05, + "loss": 0.08776435852050782, + "mean_token_accuracy": 0.9698216117918491, + "num_tokens": 5978490.0, + "step": 2560 + }, + { + "epoch": 6.3686176836861765, + "eval_entropy": 0.28109629790103713, + "eval_loss": 0.7394832968711853, + "eval_mean_token_accuracy": 0.8526893916518189, + "eval_num_tokens": 5978490.0, + "eval_runtime": 86.5096, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 2560 + }, + { + "entropy": 0.1454140623100102, + "epoch": 6.418430884184309, + "grad_norm": 0.6952065229415894, + "learning_rate": 6.911936044167146e-05, + "loss": 0.08621888756752014, + "mean_token_accuracy": 0.9713154613971711, + "num_tokens": 6025380.0, + "step": 2580 + }, + { + "epoch": 6.418430884184309, + "eval_entropy": 0.2741171905640946, + "eval_loss": 0.7543420195579529, + "eval_mean_token_accuracy": 0.8530452431634415, + "eval_num_tokens": 6025380.0, + "eval_runtime": 86.2748, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 2580 + }, + { + "entropy": 0.1498984983190894, + "epoch": 6.468244084682441, + "grad_norm": 0.48904216289520264, + "learning_rate": 6.746267867898023e-05, + "loss": 0.08652682900428772, + "mean_token_accuracy": 0.9702693298459053, + "num_tokens": 6073349.0, + "step": 2600 + }, + { + "epoch": 6.468244084682441, + "eval_entropy": 0.2762772881880749, + "eval_loss": 0.7408088445663452, + "eval_mean_token_accuracy": 0.8531355317248854, + "eval_num_tokens": 6073349.0, + "eval_runtime": 86.3263, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 2600 + }, + { + "entropy": 0.14868942834436893, + "epoch": 6.518057285180573, + "grad_norm": 0.5196901559829712, + "learning_rate": 6.581604393003236e-05, + "loss": 0.09130032062530517, + "mean_token_accuracy": 0.9702563397586346, + "num_tokens": 6118148.0, + "step": 2620 + }, + { + "epoch": 6.518057285180573, + "eval_entropy": 0.26881319327756414, + "eval_loss": 0.7546963095664978, + "eval_mean_token_accuracy": 0.852999032236809, + "eval_num_tokens": 6118148.0, + "eval_runtime": 86.3644, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.992, + "step": 2620 + }, + { + "entropy": 0.14665521653369068, + "epoch": 6.567870485678705, + "grad_norm": 0.5889317393302917, + "learning_rate": 6.417995279740927e-05, + "loss": 0.09003536105155945, + "mean_token_accuracy": 0.9698039405047894, + "num_tokens": 6165523.0, + "step": 2640 + }, + { + "epoch": 6.567870485678705, + "eval_entropy": 0.2733227195608061, + "eval_loss": 0.7500578165054321, + "eval_mean_token_accuracy": 0.8526958410823068, + "eval_num_tokens": 6165523.0, + "eval_runtime": 86.257, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 1.994, + "step": 2640 + }, + { + "entropy": 0.14399882415309548, + "epoch": 6.617683686176837, + "grad_norm": 0.6247589588165283, + "learning_rate": 6.25548987038814e-05, + "loss": 0.08689293265342712, + "mean_token_accuracy": 0.971392173320055, + "num_tokens": 6216232.0, + "step": 2660 + }, + { + "epoch": 6.617683686176837, + "eval_entropy": 0.27525238363548765, + "eval_loss": 0.7506860494613647, + "eval_mean_token_accuracy": 0.8529516337222831, + "eval_num_tokens": 6216232.0, + "eval_runtime": 86.1844, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.996, + "step": 2660 + }, + { + "entropy": 0.14995302110910416, + "epoch": 6.667496886674969, + "grad_norm": 0.6068060994148254, + "learning_rate": 6.0941371743598745e-05, + "loss": 0.08885984420776367, + "mean_token_accuracy": 0.9696493484079838, + "num_tokens": 6264807.0, + "step": 2680 + }, + { + "epoch": 6.667496886674969, + "eval_entropy": 0.2835908398725266, + "eval_loss": 0.7458326816558838, + "eval_mean_token_accuracy": 0.8517367382382237, + "eval_num_tokens": 6264807.0, + "eval_runtime": 86.66, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 2680 + }, + { + "entropy": 0.16357141444459558, + "epoch": 6.717310087173101, + "grad_norm": 0.6181513667106628, + "learning_rate": 5.933985853428513e-05, + "loss": 0.09438056945800781, + "mean_token_accuracy": 0.9676273122429848, + "num_tokens": 6308819.0, + "step": 2700 + }, + { + "epoch": 6.717310087173101, + "eval_entropy": 0.2713852625253589, + "eval_loss": 0.7483112215995789, + "eval_mean_token_accuracy": 0.8531875988078672, + "eval_num_tokens": 6308819.0, + "eval_runtime": 86.385, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 2700 + }, + { + "entropy": 0.1630424507893622, + "epoch": 6.767123287671232, + "grad_norm": 0.46826601028442383, + "learning_rate": 5.775084207048101e-05, + "loss": 0.09234987497329712, + "mean_token_accuracy": 0.9669895999133586, + "num_tokens": 6352548.0, + "step": 2720 + }, + { + "epoch": 6.767123287671232, + "eval_entropy": 0.26874022653629615, + "eval_loss": 0.7569906711578369, + "eval_mean_token_accuracy": 0.852455192180567, + "eval_num_tokens": 6352548.0, + "eval_runtime": 86.196, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.995, + "step": 2720 + }, + { + "entropy": 0.14564633751288056, + "epoch": 6.816936488169365, + "grad_norm": 0.3920297920703888, + "learning_rate": 5.6174801577878795e-05, + "loss": 0.08979449868202209, + "mean_token_accuracy": 0.9692104034125805, + "num_tokens": 6397720.0, + "step": 2740 + }, + { + "epoch": 6.816936488169365, + "eval_entropy": 0.26479411177163903, + "eval_loss": 0.7598947882652283, + "eval_mean_token_accuracy": 0.8536758384732313, + "eval_num_tokens": 6397720.0, + "eval_runtime": 86.1023, + "eval_samples_per_second": 15.981, + "eval_steps_per_second": 1.998, + "step": 2740 + }, + { + "entropy": 0.16201716642826797, + "epoch": 6.866749688667497, + "grad_norm": 0.496540367603302, + "learning_rate": 5.4612212368794904e-05, + "loss": 0.09179213643074036, + "mean_token_accuracy": 0.9680421657860279, + "num_tokens": 6442821.0, + "step": 2760 + }, + { + "epoch": 6.866749688667497, + "eval_entropy": 0.27176168924847316, + "eval_loss": 0.756536602973938, + "eval_mean_token_accuracy": 0.8528874596191007, + "eval_num_tokens": 6442821.0, + "eval_runtime": 86.1371, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2760 + }, + { + "entropy": 0.13891819408163428, + "epoch": 6.916562889165629, + "grad_norm": 0.5002485513687134, + "learning_rate": 5.3063545698822274e-05, + "loss": 0.08300527930259705, + "mean_token_accuracy": 0.971545273065567, + "num_tokens": 6494118.0, + "step": 2780 + }, + { + "epoch": 6.916562889165629, + "eval_entropy": 0.26986357344444406, + "eval_loss": 0.7550951242446899, + "eval_mean_token_accuracy": 0.8532527044068935, + "eval_num_tokens": 6494118.0, + "eval_runtime": 86.642, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 2780 + }, + { + "entropy": 0.14777150927111507, + "epoch": 6.966376089663761, + "grad_norm": 0.35520732402801514, + "learning_rate": 5.152926862470571e-05, + "loss": 0.08964785933494568, + "mean_token_accuracy": 0.9702881813049317, + "num_tokens": 6540175.0, + "step": 2800 + }, + { + "epoch": 6.966376089663761, + "eval_entropy": 0.26697341023489485, + "eval_loss": 0.753479540348053, + "eval_mean_token_accuracy": 0.8532822423203047, + "eval_num_tokens": 6540175.0, + "eval_runtime": 86.6313, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 2800 + }, + { + "entropy": 0.16215767501256403, + "epoch": 7.01494396014944, + "grad_norm": 0.41724473237991333, + "learning_rate": 5.0009843863484395e-05, + "loss": 0.0857824981212616, + "mean_token_accuracy": 0.9699622369729556, + "num_tokens": 6583767.0, + "step": 2820 + }, + { + "epoch": 7.01494396014944, + "eval_entropy": 0.255824513473483, + "eval_loss": 0.773139238357544, + "eval_mean_token_accuracy": 0.8542473659265873, + "eval_num_tokens": 6583767.0, + "eval_runtime": 86.2663, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.994, + "step": 2820 + }, + { + "entropy": 0.13403823282569646, + "epoch": 7.064757160647572, + "grad_norm": 0.5895716547966003, + "learning_rate": 4.8505729652942433e-05, + "loss": 0.07477729320526123, + "mean_token_accuracy": 0.9744169726967812, + "num_tokens": 6627672.0, + "step": 2840 + }, + { + "epoch": 7.064757160647572, + "eval_entropy": 0.24803267142107321, + "eval_loss": 0.8059361577033997, + "eval_mean_token_accuracy": 0.8533402220454327, + "eval_num_tokens": 6627672.0, + "eval_runtime": 86.2105, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.995, + "step": 2840 + }, + { + "entropy": 0.12771664513275027, + "epoch": 7.114570361145703, + "grad_norm": 0.22397534549236298, + "learning_rate": 4.7017379613410626e-05, + "loss": 0.06963326930999755, + "mean_token_accuracy": 0.9753161281347275, + "num_tokens": 6672946.0, + "step": 2860 + }, + { + "epoch": 7.114570361145703, + "eval_entropy": 0.2530888926324456, + "eval_loss": 0.809047520160675, + "eval_mean_token_accuracy": 0.8522793931323428, + "eval_num_tokens": 6672946.0, + "eval_runtime": 86.219, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.995, + "step": 2860 + }, + { + "entropy": 0.12172898761928082, + "epoch": 7.164383561643835, + "grad_norm": 0.5140368342399597, + "learning_rate": 4.554524261096081e-05, + "loss": 0.06878940463066101, + "mean_token_accuracy": 0.9762930549681187, + "num_tokens": 6718582.0, + "step": 2880 + }, + { + "epoch": 7.164383561643835, + "eval_entropy": 0.2459391265414482, + "eval_loss": 0.8392541408538818, + "eval_mean_token_accuracy": 0.8528771050447641, + "eval_num_tokens": 6718582.0, + "eval_runtime": 85.9805, + "eval_samples_per_second": 16.004, + "eval_steps_per_second": 2.0, + "step": 2880 + }, + { + "entropy": 0.12581687197089195, + "epoch": 7.214196762141968, + "grad_norm": 0.28926676511764526, + "learning_rate": 4.408976262203404e-05, + "loss": 0.07077260017395019, + "mean_token_accuracy": 0.975715234130621, + "num_tokens": 6764387.0, + "step": 2900 + }, + { + "epoch": 7.214196762141968, + "eval_entropy": 0.24933571585042533, + "eval_loss": 0.8336001634597778, + "eval_mean_token_accuracy": 0.8527654329704684, + "eval_num_tokens": 6764387.0, + "eval_runtime": 85.2853, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.017, + "step": 2900 + }, + { + "entropy": 0.13015523147769273, + "epoch": 7.2640099626401, + "grad_norm": 0.31048327684402466, + "learning_rate": 4.2651378599543286e-05, + "loss": 0.07249900102615356, + "mean_token_accuracy": 0.9749723896384239, + "num_tokens": 6809678.0, + "step": 2920 + }, + { + "epoch": 7.2640099626401, + "eval_entropy": 0.2481014168886251, + "eval_loss": 0.8247711062431335, + "eval_mean_token_accuracy": 0.8533733261879101, + "eval_num_tokens": 6809678.0, + "eval_runtime": 86.1337, + "eval_samples_per_second": 15.975, + "eval_steps_per_second": 1.997, + "step": 2920 + }, + { + "entropy": 0.11947155892848968, + "epoch": 7.313823163138232, + "grad_norm": 0.3158417046070099, + "learning_rate": 4.123052434049112e-05, + "loss": 0.06591642498970032, + "mean_token_accuracy": 0.9769096739590168, + "num_tokens": 6860750.0, + "step": 2940 + }, + { + "epoch": 7.313823163138232, + "eval_entropy": 0.24779942059932752, + "eval_loss": 0.8287138938903809, + "eval_mean_token_accuracy": 0.8529684456974961, + "eval_num_tokens": 6860750.0, + "eval_runtime": 86.1438, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.997, + "step": 2940 + }, + { + "entropy": 0.13140737023204566, + "epoch": 7.363636363636363, + "grad_norm": 0.5523769855499268, + "learning_rate": 3.9827628355142654e-05, + "loss": 0.0709549367427826, + "mean_token_accuracy": 0.974937304854393, + "num_tokens": 6907092.0, + "step": 2960 + }, + { + "epoch": 7.363636363636363, + "eval_entropy": 0.24850021077449932, + "eval_loss": 0.8252517580986023, + "eval_mean_token_accuracy": 0.8539477028819018, + "eval_num_tokens": 6907092.0, + "eval_runtime": 86.4886, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 2960 + }, + { + "entropy": 0.13003513137809933, + "epoch": 7.4134495641344955, + "grad_norm": 0.4664781391620636, + "learning_rate": 3.844311373779252e-05, + "loss": 0.07174457907676697, + "mean_token_accuracy": 0.9750649809837342, + "num_tokens": 6952700.0, + "step": 2980 + }, + { + "epoch": 7.4134495641344955, + "eval_entropy": 0.24727656943506973, + "eval_loss": 0.8217361569404602, + "eval_mean_token_accuracy": 0.8543338027111319, + "eval_num_tokens": 6952700.0, + "eval_runtime": 86.2981, + "eval_samples_per_second": 15.945, + "eval_steps_per_second": 1.993, + "step": 2980 + }, + { + "entropy": 0.13791935429908336, + "epoch": 7.463262764632628, + "grad_norm": 0.30846619606018066, + "learning_rate": 3.7077398039165516e-05, + "loss": 0.07441290616989135, + "mean_token_accuracy": 0.9730765089392662, + "num_tokens": 6996430.0, + "step": 3000 + }, + { + "epoch": 7.463262764632628, + "eval_entropy": 0.25024019753517107, + "eval_loss": 0.8234542012214661, + "eval_mean_token_accuracy": 0.8529301455547643, + "eval_num_tokens": 6996430.0, + "eval_runtime": 86.1868, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.996, + "step": 3000 + }, + { + "entropy": 0.1354162965901196, + "epoch": 7.51307596513076, + "grad_norm": 0.30689817667007446, + "learning_rate": 3.573089314048897e-05, + "loss": 0.07313602566719055, + "mean_token_accuracy": 0.9747377909719944, + "num_tokens": 7042038.0, + "step": 3020 + }, + { + "epoch": 7.51307596513076, + "eval_entropy": 0.24558737484175105, + "eval_loss": 0.8214292526245117, + "eval_mean_token_accuracy": 0.8544686381206956, + "eval_num_tokens": 7042038.0, + "eval_runtime": 86.406, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3020 + }, + { + "entropy": 0.12779442030005156, + "epoch": 7.562889165628892, + "grad_norm": 0.4416750967502594, + "learning_rate": 3.4404005129274905e-05, + "loss": 0.07139642834663391, + "mean_token_accuracy": 0.9753781862556934, + "num_tokens": 7089390.0, + "step": 3040 + }, + { + "epoch": 7.562889165628892, + "eval_entropy": 0.24580405817128892, + "eval_loss": 0.8302819132804871, + "eval_mean_token_accuracy": 0.8540662842434507, + "eval_num_tokens": 7089390.0, + "eval_runtime": 86.5957, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.986, + "step": 3040 + }, + { + "entropy": 0.12047688071615995, + "epoch": 7.6127023661270234, + "grad_norm": 0.5483342409133911, + "learning_rate": 3.309713417684963e-05, + "loss": 0.06730042099952697, + "mean_token_accuracy": 0.9768634103238583, + "num_tokens": 7138002.0, + "step": 3060 + }, + { + "epoch": 7.6127023661270234, + "eval_entropy": 0.24299402422336644, + "eval_loss": 0.831507682800293, + "eval_mean_token_accuracy": 0.8545246692590935, + "eval_num_tokens": 7138002.0, + "eval_runtime": 86.4733, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 3060 + }, + { + "entropy": 0.1223155280109495, + "epoch": 7.662515566625156, + "grad_norm": 0.23236846923828125, + "learning_rate": 3.181067441766772e-05, + "loss": 0.06945533752441406, + "mean_token_accuracy": 0.9759405627846718, + "num_tokens": 7185520.0, + "step": 3080 + }, + { + "epoch": 7.662515566625156, + "eval_entropy": 0.24285893584060114, + "eval_loss": 0.8383913040161133, + "eval_mean_token_accuracy": 0.8540910773499067, + "eval_num_tokens": 7185520.0, + "eval_runtime": 86.4055, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.991, + "step": 3080 + }, + { + "entropy": 0.12549724937416612, + "epoch": 7.712328767123288, + "grad_norm": 0.5445857048034668, + "learning_rate": 3.054501383044605e-05, + "loss": 0.07318683862686157, + "mean_token_accuracy": 0.9748943917453289, + "num_tokens": 7232170.0, + "step": 3100 + }, + { + "epoch": 7.712328767123288, + "eval_entropy": 0.24052567260209903, + "eval_loss": 0.8307085037231445, + "eval_mean_token_accuracy": 0.8547526040049487, + "eval_num_tokens": 7232170.0, + "eval_runtime": 86.627, + "eval_samples_per_second": 15.884, + "eval_steps_per_second": 1.986, + "step": 3100 + }, + { + "entropy": 0.11182957985438406, + "epoch": 7.76214196762142, + "grad_norm": 0.5338284969329834, + "learning_rate": 2.9300534121155e-05, + "loss": 0.06559510231018066, + "mean_token_accuracy": 0.9782855957746506, + "num_tokens": 7282846.0, + "step": 3120 + }, + { + "epoch": 7.76214196762142, + "eval_entropy": 0.2438461010365985, + "eval_loss": 0.8223569989204407, + "eval_mean_token_accuracy": 0.8548611496077028, + "eval_num_tokens": 7282846.0, + "eval_runtime": 86.6, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3120 + }, + { + "entropy": 0.12523467522114515, + "epoch": 7.811955168119551, + "grad_norm": 0.4262288808822632, + "learning_rate": 2.807761060790107e-05, + "loss": 0.06978838443756104, + "mean_token_accuracy": 0.9748328007757664, + "num_tokens": 7331518.0, + "step": 3140 + }, + { + "epoch": 7.811955168119551, + "eval_entropy": 0.2413516822595929, + "eval_loss": 0.8272029161453247, + "eval_mean_token_accuracy": 0.8549864254025525, + "eval_num_tokens": 7331518.0, + "eval_runtime": 86.6091, + "eval_samples_per_second": 15.887, + "eval_steps_per_second": 1.986, + "step": 3140 + }, + { + "entropy": 0.12787675098516046, + "epoch": 7.861768368617684, + "grad_norm": 0.4428657591342926, + "learning_rate": 2.687661210773607e-05, + "loss": 0.06889715790748596, + "mean_token_accuracy": 0.973549035936594, + "num_tokens": 7379056.0, + "step": 3160 + }, + { + "epoch": 7.861768368617684, + "eval_entropy": 0.24256615280065424, + "eval_loss": 0.8303911089897156, + "eval_mean_token_accuracy": 0.8550452936527341, + "eval_num_tokens": 7379056.0, + "eval_runtime": 86.637, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3160 + }, + { + "entropy": 0.12699329359456896, + "epoch": 7.911581569115816, + "grad_norm": 0.20887182652950287, + "learning_rate": 2.5697900825426814e-05, + "loss": 0.07120747566223144, + "mean_token_accuracy": 0.9752186723053455, + "num_tokens": 7424770.0, + "step": 3180 + }, + { + "epoch": 7.911581569115816, + "eval_entropy": 0.24418324786563253, + "eval_loss": 0.825463593006134, + "eval_mean_token_accuracy": 0.8547488301992416, + "eval_num_tokens": 7424770.0, + "eval_runtime": 86.4434, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 3180 + }, + { + "entropy": 0.13169807861559094, + "epoch": 7.961394769613948, + "grad_norm": 0.1804407387971878, + "learning_rate": 2.4541832244219308e-05, + "loss": 0.0711442768573761, + "mean_token_accuracy": 0.9736054383218289, + "num_tokens": 7470804.0, + "step": 3200 + }, + { + "epoch": 7.961394769613948, + "eval_entropy": 0.2437171469074349, + "eval_loss": 0.8287582993507385, + "eval_mean_token_accuracy": 0.8545196194981419, + "eval_num_tokens": 7470804.0, + "eval_runtime": 86.6395, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 3200 + }, + { + "entropy": 0.11447950548086411, + "epoch": 8.009962640099626, + "grad_norm": 0.11681001633405685, + "learning_rate": 2.3408755018629662e-05, + "loss": 0.0648022472858429, + "mean_token_accuracy": 0.9776463088316795, + "num_tokens": 7518110.0, + "step": 3220 + }, + { + "epoch": 8.009962640099626, + "eval_entropy": 0.2403542645448862, + "eval_loss": 0.8375888466835022, + "eval_mean_token_accuracy": 0.8546101745477942, + "eval_num_tokens": 7518110.0, + "eval_runtime": 86.6664, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.985, + "step": 3220 + }, + { + "entropy": 0.12123392843641341, + "epoch": 8.059775840597759, + "grad_norm": 0.14732785522937775, + "learning_rate": 2.229901086929465e-05, + "loss": 0.06151747703552246, + "mean_token_accuracy": 0.9774191610515117, + "num_tokens": 7565539.0, + "step": 3240 + }, + { + "epoch": 8.059775840597759, + "eval_entropy": 0.2306776445272357, + "eval_loss": 0.8743928670883179, + "eval_mean_token_accuracy": 0.8543573676846749, + "eval_num_tokens": 7565539.0, + "eval_runtime": 86.5684, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.987, + "step": 3240 + }, + { + "entropy": 0.1161969758104533, + "epoch": 8.10958904109589, + "grad_norm": 0.15050369501113892, + "learning_rate": 2.1212934479913717e-05, + "loss": 0.06055923104286194, + "mean_token_accuracy": 0.9778320029377937, + "num_tokens": 7612578.0, + "step": 3260 + }, + { + "epoch": 8.10958904109589, + "eval_entropy": 0.2284980574839337, + "eval_loss": 0.8921975493431091, + "eval_mean_token_accuracy": 0.853883276498595, + "eval_num_tokens": 7612578.0, + "eval_runtime": 86.5997, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3260 + }, + { + "entropy": 0.11528769815340638, + "epoch": 8.159402241594023, + "grad_norm": 0.13709086179733276, + "learning_rate": 2.0150853396312505e-05, + "loss": 0.060501879453659056, + "mean_token_accuracy": 0.9761978469789028, + "num_tokens": 7660157.0, + "step": 3280 + }, + { + "epoch": 8.159402241594023, + "eval_entropy": 0.23356944929028667, + "eval_loss": 0.8960044384002686, + "eval_mean_token_accuracy": 0.8533267111972321, + "eval_num_tokens": 7660157.0, + "eval_runtime": 86.1662, + "eval_samples_per_second": 15.969, + "eval_steps_per_second": 1.996, + "step": 3280 + }, + { + "entropy": 0.11450630058534443, + "epoch": 8.209215442092155, + "grad_norm": 0.19220037758350372, + "learning_rate": 1.9113087927659777e-05, + "loss": 0.05981999635696411, + "mean_token_accuracy": 0.9785088717937469, + "num_tokens": 7709745.0, + "step": 3300 + }, + { + "epoch": 8.209215442092155, + "eval_entropy": 0.23030704779680386, + "eval_loss": 0.9033364653587341, + "eval_mean_token_accuracy": 0.8539317641840425, + "eval_num_tokens": 7709745.0, + "eval_runtime": 86.5804, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.987, + "step": 3300 + }, + { + "entropy": 0.12258679773658514, + "epoch": 8.259028642590286, + "grad_norm": 0.1550113558769226, + "learning_rate": 1.80999510498665e-05, + "loss": 0.06708189249038696, + "mean_token_accuracy": 0.9755175545811653, + "num_tokens": 7753571.0, + "step": 3320 + }, + { + "epoch": 8.259028642590286, + "eval_entropy": 0.22794587762896404, + "eval_loss": 0.9068623185157776, + "eval_mean_token_accuracy": 0.8544069556302802, + "eval_num_tokens": 7753571.0, + "eval_runtime": 86.54, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.988, + "step": 3320 + }, + { + "entropy": 0.11094769332557916, + "epoch": 8.308841843088418, + "grad_norm": 0.17563068866729736, + "learning_rate": 1.7111748311196566e-05, + "loss": 0.06247819066047668, + "mean_token_accuracy": 0.9774838156998158, + "num_tokens": 7799310.0, + "step": 3340 + }, + { + "epoch": 8.308841843088418, + "eval_entropy": 0.22996614700139956, + "eval_loss": 0.9062461853027344, + "eval_mean_token_accuracy": 0.8542992434529371, + "eval_num_tokens": 7799310.0, + "eval_runtime": 86.5131, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3340 + }, + { + "entropy": 0.11153676519170404, + "epoch": 8.35865504358655, + "grad_norm": 0.17450673878192902, + "learning_rate": 1.61487777401175e-05, + "loss": 0.06058149337768555, + "mean_token_accuracy": 0.9782821990549564, + "num_tokens": 7846447.0, + "step": 3360 + }, + { + "epoch": 8.35865504358655, + "eval_entropy": 0.22868362528293631, + "eval_loss": 0.9072180390357971, + "eval_mean_token_accuracy": 0.8541580455940824, + "eval_num_tokens": 7846447.0, + "eval_runtime": 86.3954, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 3360 + }, + { + "entropy": 0.12306302534416318, + "epoch": 8.408468244084682, + "grad_norm": 0.1664905995130539, + "learning_rate": 1.5211329755419379e-05, + "loss": 0.06635981798171997, + "mean_token_accuracy": 0.9746963500976562, + "num_tokens": 7890283.0, + "step": 3380 + }, + { + "epoch": 8.408468244084682, + "eval_entropy": 0.22899940029479737, + "eval_loss": 0.9086405634880066, + "eval_mean_token_accuracy": 0.8544029343959897, + "eval_num_tokens": 7890283.0, + "eval_runtime": 86.0555, + "eval_samples_per_second": 15.99, + "eval_steps_per_second": 1.999, + "step": 3380 + }, + { + "entropy": 0.11208283659070731, + "epoch": 8.458281444582815, + "grad_norm": 0.13771440088748932, + "learning_rate": 1.4299687078628192e-05, + "loss": 0.06289162039756775, + "mean_token_accuracy": 0.9773342818021774, + "num_tokens": 7936518.0, + "step": 3400 + }, + { + "epoch": 8.458281444582815, + "eval_entropy": 0.23098262182848397, + "eval_loss": 0.908290445804596, + "eval_mean_token_accuracy": 0.8537809270065885, + "eval_num_tokens": 7936518.0, + "eval_runtime": 86.7831, + "eval_samples_per_second": 15.856, + "eval_steps_per_second": 1.982, + "step": 3400 + }, + { + "entropy": 0.12039995044469834, + "epoch": 8.508094645080947, + "grad_norm": 0.19003549218177795, + "learning_rate": 1.3414124648741076e-05, + "loss": 0.06479687690734863, + "mean_token_accuracy": 0.9768574126064777, + "num_tokens": 7981966.0, + "step": 3420 + }, + { + "epoch": 8.508094645080947, + "eval_entropy": 0.22869066452217657, + "eval_loss": 0.9068775773048401, + "eval_mean_token_accuracy": 0.8537808739861776, + "eval_num_tokens": 7981966.0, + "eval_runtime": 86.6167, + "eval_samples_per_second": 15.886, + "eval_steps_per_second": 1.986, + "step": 3420 + }, + { + "entropy": 0.11591865480877458, + "epoch": 8.557907845579079, + "grad_norm": 0.17412032186985016, + "learning_rate": 1.2554909539308509e-05, + "loss": 0.06449685096740723, + "mean_token_accuracy": 0.9773017890751362, + "num_tokens": 8028367.0, + "step": 3440 + }, + { + "epoch": 8.557907845579079, + "eval_entropy": 0.22861102136761643, + "eval_loss": 0.9029546976089478, + "eval_mean_token_accuracy": 0.8541917676149413, + "eval_num_tokens": 8028367.0, + "eval_runtime": 86.5545, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 3440 + }, + { + "entropy": 0.11211966630071402, + "epoch": 8.607721046077211, + "grad_norm": 0.17846721410751343, + "learning_rate": 1.1722300877888353e-05, + "loss": 0.06400871276855469, + "mean_token_accuracy": 0.977227509766817, + "num_tokens": 8074934.0, + "step": 3460 + }, + { + "epoch": 8.607721046077211, + "eval_entropy": 0.2299522036729857, + "eval_loss": 0.9003680944442749, + "eval_mean_token_accuracy": 0.8541547486255335, + "eval_num_tokens": 8074934.0, + "eval_runtime": 86.4928, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 3460 + }, + { + "entropy": 0.11539406068623066, + "epoch": 8.657534246575342, + "grad_norm": 0.18916265666484833, + "learning_rate": 1.0916549767896689e-05, + "loss": 0.060999685525894166, + "mean_token_accuracy": 0.9764547064900398, + "num_tokens": 8122775.0, + "step": 3480 + }, + { + "epoch": 8.657534246575342, + "eval_entropy": 0.2297502622701401, + "eval_loss": 0.9047583937644958, + "eval_mean_token_accuracy": 0.8540163729773012, + "eval_num_tokens": 8122775.0, + "eval_runtime": 86.5128, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3480 + }, + { + "entropy": 0.10462163621559739, + "epoch": 8.707347447073474, + "grad_norm": 0.4441547095775604, + "learning_rate": 1.0137899212878408e-05, + "loss": 0.0585650622844696, + "mean_token_accuracy": 0.9779789052903652, + "num_tokens": 8174307.0, + "step": 3500 + }, + { + "epoch": 8.707347447073474, + "eval_entropy": 0.2297880021465379, + "eval_loss": 0.9056211113929749, + "eval_mean_token_accuracy": 0.8541018741075382, + "eval_num_tokens": 8174307.0, + "eval_runtime": 86.5534, + "eval_samples_per_second": 15.898, + "eval_steps_per_second": 1.987, + "step": 3500 + }, + { + "entropy": 0.11884278021752834, + "epoch": 8.757160647571606, + "grad_norm": 0.21446974575519562, + "learning_rate": 9.386584043220699e-06, + "loss": 0.06243965029716492, + "mean_token_accuracy": 0.9768765904009342, + "num_tokens": 8222808.0, + "step": 3520 + }, + { + "epoch": 8.757160647571606, + "eval_entropy": 0.22878494226308757, + "eval_loss": 0.9047290086746216, + "eval_mean_token_accuracy": 0.8544826070929683, + "eval_num_tokens": 8222808.0, + "eval_runtime": 86.6241, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3520 + }, + { + "entropy": 0.10786062851548195, + "epoch": 8.806973848069738, + "grad_norm": 0.1993892788887024, + "learning_rate": 8.662830845331275e-06, + "loss": 0.058893626928329466, + "mean_token_accuracy": 0.9780589491128922, + "num_tokens": 8273335.0, + "step": 3540 + }, + { + "epoch": 8.806973848069738, + "eval_entropy": 0.22842735658551372, + "eval_loss": 0.9033588767051697, + "eval_mean_token_accuracy": 0.8544253273758777, + "eval_num_tokens": 8273335.0, + "eval_runtime": 86.5047, + "eval_samples_per_second": 15.907, + "eval_steps_per_second": 1.988, + "step": 3540 + }, + { + "entropy": 0.12962863883003592, + "epoch": 8.85678704856787, + "grad_norm": 0.19105808436870575, + "learning_rate": 7.96685789330315e-06, + "loss": 0.06916859149932861, + "mean_token_accuracy": 0.9734630741178989, + "num_tokens": 8315235.0, + "step": 3560 + }, + { + "epoch": 8.85678704856787, + "eval_entropy": 0.22824140811382337, + "eval_loss": 0.9058244228363037, + "eval_mean_token_accuracy": 0.8543548379526582, + "eval_num_tokens": 8315235.0, + "eval_runtime": 86.0706, + "eval_samples_per_second": 15.987, + "eval_steps_per_second": 1.998, + "step": 3560 + }, + { + "entropy": 0.1322095939423889, + "epoch": 8.906600249066003, + "grad_norm": 0.1588907092809677, + "learning_rate": 7.29887508308606e-06, + "loss": 0.0700787365436554, + "mean_token_accuracy": 0.9730628825724125, + "num_tokens": 8358099.0, + "step": 3580 + }, + { + "epoch": 8.906600249066003, + "eval_entropy": 0.22754066853329194, + "eval_loss": 0.907920777797699, + "eval_mean_token_accuracy": 0.8542819754328839, + "eval_num_tokens": 8358099.0, + "eval_runtime": 86.6425, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 3580 + }, + { + "entropy": 0.11120554907247424, + "epoch": 8.956413449564135, + "grad_norm": 0.15471689403057098, + "learning_rate": 6.659083869184757e-06, + "loss": 0.06011306643486023, + "mean_token_accuracy": 0.9776862308382988, + "num_tokens": 8407430.0, + "step": 3600 + }, + { + "epoch": 8.956413449564135, + "eval_entropy": 0.22583809070462404, + "eval_loss": 0.9105515480041504, + "eval_mean_token_accuracy": 0.8541878475699314, + "eval_num_tokens": 8407430.0, + "eval_runtime": 86.382, + "eval_samples_per_second": 15.929, + "eval_steps_per_second": 1.991, + "step": 3600 + }, + { + "entropy": 0.11786058268103844, + "epoch": 9.004981320049813, + "grad_norm": 0.11580188572406769, + "learning_rate": 6.047677203903052e-06, + "loss": 0.062467324733734134, + "mean_token_accuracy": 0.9768382952763484, + "num_tokens": 8453175.0, + "step": 3620 + }, + { + "epoch": 9.004981320049813, + "eval_entropy": 0.2257705934692261, + "eval_loss": 0.9105263352394104, + "eval_mean_token_accuracy": 0.8544646265894867, + "eval_num_tokens": 8453175.0, + "eval_runtime": 86.6206, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 3620 + }, + { + "entropy": 0.1176839429885149, + "epoch": 9.054794520547945, + "grad_norm": 0.1505710333585739, + "learning_rate": 5.4648394791520385e-06, + "loss": 0.06264145970344544, + "mean_token_accuracy": 0.9776909500360489, + "num_tokens": 8497151.0, + "step": 3640 + }, + { + "epoch": 9.054794520547945, + "eval_entropy": 0.22336089827640113, + "eval_loss": 0.9186719059944153, + "eval_mean_token_accuracy": 0.8543131739594215, + "eval_num_tokens": 8497151.0, + "eval_runtime": 86.5077, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3640 + }, + { + "entropy": 0.1169667155481875, + "epoch": 9.104607721046078, + "grad_norm": 0.13833528757095337, + "learning_rate": 4.910746470839993e-06, + "loss": 0.059957253932952884, + "mean_token_accuracy": 0.9770020335912705, + "num_tokens": 8542996.0, + "step": 3660 + }, + { + "epoch": 9.104607721046078, + "eval_entropy": 0.2224627248942852, + "eval_loss": 0.926105260848999, + "eval_mean_token_accuracy": 0.8542806360610696, + "eval_num_tokens": 8542996.0, + "eval_runtime": 86.6778, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3660 + }, + { + "entropy": 0.10592180709354579, + "epoch": 9.15442092154421, + "grad_norm": 0.15626424551010132, + "learning_rate": 4.385565285860771e-06, + "loss": 0.05797492861747742, + "mean_token_accuracy": 0.9791826255619526, + "num_tokens": 8591625.0, + "step": 3680 + }, + { + "epoch": 9.15442092154421, + "eval_entropy": 0.22266393605359766, + "eval_loss": 0.9309298396110535, + "eval_mean_token_accuracy": 0.854311544534772, + "eval_num_tokens": 8591625.0, + "eval_runtime": 86.7402, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.983, + "step": 3680 + }, + { + "entropy": 0.1101202143356204, + "epoch": 9.204234122042342, + "grad_norm": 0.16745513677597046, + "learning_rate": 3.8894543116967004e-06, + "loss": 0.05827975273132324, + "mean_token_accuracy": 0.9780424386262894, + "num_tokens": 8639845.0, + "step": 3700 + }, + { + "epoch": 9.204234122042342, + "eval_entropy": 0.22291506272415781, + "eval_loss": 0.9343715906143188, + "eval_mean_token_accuracy": 0.8542290634887163, + "eval_num_tokens": 8639845.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.989, + "step": 3700 + }, + { + "entropy": 0.11024559773504734, + "epoch": 9.254047322540472, + "grad_norm": 0.19114018976688385, + "learning_rate": 3.422563168650925e-06, + "loss": 0.059362989664077756, + "mean_token_accuracy": 0.9786941170692444, + "num_tokens": 8687194.0, + "step": 3720 + }, + { + "epoch": 9.254047322540472, + "eval_entropy": 0.22341064467679622, + "eval_loss": 0.9363839626312256, + "eval_mean_token_accuracy": 0.8541977516440458, + "eval_num_tokens": 8687194.0, + "eval_runtime": 86.2678, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 3720 + }, + { + "entropy": 0.12186863766983151, + "epoch": 9.303860523038605, + "grad_norm": 0.12053123861551285, + "learning_rate": 2.985032664724181e-06, + "loss": 0.0631858766078949, + "mean_token_accuracy": 0.9755026556551456, + "num_tokens": 8731721.0, + "step": 3740 + }, + { + "epoch": 9.303860523038605, + "eval_entropy": 0.222989774807248, + "eval_loss": 0.9386691451072693, + "eval_mean_token_accuracy": 0.8542838827815167, + "eval_num_tokens": 8731721.0, + "eval_runtime": 86.5086, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.988, + "step": 3740 + }, + { + "entropy": 0.11424487661570311, + "epoch": 9.353673723536737, + "grad_norm": 0.15845441818237305, + "learning_rate": 2.5769947531487898e-06, + "loss": 0.058484512567520144, + "mean_token_accuracy": 0.9783759318292141, + "num_tokens": 8778614.0, + "step": 3760 + }, + { + "epoch": 9.353673723536737, + "eval_entropy": 0.22231103705112323, + "eval_loss": 0.9413615465164185, + "eval_mean_token_accuracy": 0.8542899021575617, + "eval_num_tokens": 8778614.0, + "eval_runtime": 86.6015, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.986, + "step": 3760 + }, + { + "entropy": 0.10592789361253381, + "epoch": 9.403486924034869, + "grad_norm": 0.17964792251586914, + "learning_rate": 2.198572492593547e-06, + "loss": 0.05741395354270935, + "mean_token_accuracy": 0.9798030756413937, + "num_tokens": 8826551.0, + "step": 3780 + }, + { + "epoch": 9.403486924034869, + "eval_entropy": 0.22196386511935745, + "eval_loss": 0.9433969855308533, + "eval_mean_token_accuracy": 0.854294165968895, + "eval_num_tokens": 8826551.0, + "eval_runtime": 86.2332, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 3780 + }, + { + "entropy": 0.10031416746787727, + "epoch": 9.453300124533001, + "grad_norm": 0.1429711878299713, + "learning_rate": 1.8498800100508529e-06, + "loss": 0.05553470253944397, + "mean_token_accuracy": 0.9798915058374404, + "num_tokens": 8876556.0, + "step": 3800 + }, + { + "epoch": 9.453300124533001, + "eval_entropy": 0.22204235256757848, + "eval_loss": 0.9440023899078369, + "eval_mean_token_accuracy": 0.8542058128257131, + "eval_num_tokens": 8876556.0, + "eval_runtime": 86.3026, + "eval_samples_per_second": 15.944, + "eval_steps_per_second": 1.993, + "step": 3800 + }, + { + "entropy": 0.11637815865688025, + "epoch": 9.503113325031133, + "grad_norm": 0.2096358835697174, + "learning_rate": 1.5310224664174822e-06, + "loss": 0.06322363018989563, + "mean_token_accuracy": 0.9764002375304699, + "num_tokens": 8920286.0, + "step": 3820 + }, + { + "epoch": 9.503113325031133, + "eval_entropy": 0.2220806197025055, + "eval_loss": 0.9451368451118469, + "eval_mean_token_accuracy": 0.8541916636533515, + "eval_num_tokens": 8920286.0, + "eval_runtime": 85.7157, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.007, + "step": 3820 + }, + { + "entropy": 0.11271723550744354, + "epoch": 9.552926525529266, + "grad_norm": 0.1656704694032669, + "learning_rate": 1.242096024779613e-06, + "loss": 0.06295235753059387, + "mean_token_accuracy": 0.9773425675928593, + "num_tokens": 8964464.0, + "step": 3840 + }, + { + "epoch": 9.552926525529266, + "eval_entropy": 0.22215987785264504, + "eval_loss": 0.9458719491958618, + "eval_mean_token_accuracy": 0.8541110656982245, + "eval_num_tokens": 8964464.0, + "eval_runtime": 86.5137, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3840 + }, + { + "entropy": 0.10917426198720932, + "epoch": 9.602739726027398, + "grad_norm": 0.13864120841026306, + "learning_rate": 9.831878214112889e-07, + "loss": 0.05977686643600464, + "mean_token_accuracy": 0.9781549699604511, + "num_tokens": 9010414.0, + "step": 3860 + }, + { + "epoch": 9.602739726027398, + "eval_entropy": 0.2222186531438384, + "eval_loss": 0.9462024569511414, + "eval_mean_token_accuracy": 0.854135605831479, + "eval_num_tokens": 9010414.0, + "eval_runtime": 86.8131, + "eval_samples_per_second": 15.85, + "eval_steps_per_second": 1.981, + "step": 3860 + }, + { + "entropy": 0.11271071215160192, + "epoch": 9.65255292652553, + "grad_norm": 0.11838250607252121, + "learning_rate": 7.543759394953306e-07, + "loss": 0.05857791900634766, + "mean_token_accuracy": 0.9779338933527469, + "num_tokens": 9058053.0, + "step": 3880 + }, + { + "epoch": 9.65255292652553, + "eval_entropy": 0.22224785959304766, + "eval_loss": 0.9465001225471497, + "eval_mean_token_accuracy": 0.8541611557783082, + "eval_num_tokens": 9058053.0, + "eval_runtime": 86.5138, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.988, + "step": 3880 + }, + { + "entropy": 0.11316167968325316, + "epoch": 9.70236612702366, + "grad_norm": 0.17645999789237976, + "learning_rate": 5.557293855744779e-07, + "loss": 0.0591269850730896, + "mean_token_accuracy": 0.9781935609877109, + "num_tokens": 9105574.0, + "step": 3900 + }, + { + "epoch": 9.70236612702366, + "eval_entropy": 0.22210437345296838, + "eval_loss": 0.9471818804740906, + "eval_mean_token_accuracy": 0.8540260292762933, + "eval_num_tokens": 9105574.0, + "eval_runtime": 86.584, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 3900 + }, + { + "entropy": 0.106583485705778, + "epoch": 9.752179327521793, + "grad_norm": 0.15395089983940125, + "learning_rate": 3.873080687399946e-07, + "loss": 0.05827186107635498, + "mean_token_accuracy": 0.9790284238755703, + "num_tokens": 9152793.0, + "step": 3920 + }, + { + "epoch": 9.752179327521793, + "eval_entropy": 0.22207596369607505, + "eval_loss": 0.9475951194763184, + "eval_mean_token_accuracy": 0.8541645428469015, + "eval_num_tokens": 9152793.0, + "eval_runtime": 86.5265, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.988, + "step": 3920 + }, + { + "entropy": 0.11190549619495868, + "epoch": 9.801992528019925, + "grad_norm": 0.2091812938451767, + "learning_rate": 2.491627825638833e-07, + "loss": 0.060925132036209105, + "mean_token_accuracy": 0.9769984439015389, + "num_tokens": 9199382.0, + "step": 3940 + }, + { + "epoch": 9.801992528019925, + "eval_entropy": 0.221953320468581, + "eval_loss": 0.9476391077041626, + "eval_mean_token_accuracy": 0.854084026328353, + "eval_num_tokens": 9199382.0, + "eval_runtime": 86.0341, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 1.999, + "step": 3940 + }, + { + "entropy": 0.10218957955949008, + "epoch": 9.851805728518057, + "grad_norm": 0.12602899968624115, + "learning_rate": 1.4133518978026882e-07, + "loss": 0.053277283906936646, + "mean_token_accuracy": 0.9792918466031552, + "num_tokens": 9251912.0, + "step": 3960 + }, + { + "epoch": 9.851805728518057, + "eval_entropy": 0.22203073113463645, + "eval_loss": 0.9477459192276001, + "eval_mean_token_accuracy": 0.8541027304044989, + "eval_num_tokens": 9251912.0, + "eval_runtime": 86.6774, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.984, + "step": 3960 + }, + { + "entropy": 0.11482724891975522, + "epoch": 9.90161892901619, + "grad_norm": 0.1705685257911682, + "learning_rate": 6.38578097204261e-08, + "loss": 0.061809581518173215, + "mean_token_accuracy": 0.9767013140022754, + "num_tokens": 9296482.0, + "step": 3980 + }, + { + "epoch": 9.90161892901619, + "eval_entropy": 0.22197876593401267, + "eval_loss": 0.947809636592865, + "eval_mean_token_accuracy": 0.8540589556444523, + "eval_num_tokens": 9296482.0, + "eval_runtime": 86.9626, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.978, + "step": 3980 + }, + { + "entropy": 0.1206501518841833, + "epoch": 9.951432129514322, + "grad_norm": 0.17280042171478271, + "learning_rate": 1.675400850544711e-08, + "loss": 0.06324169635772706, + "mean_token_accuracy": 0.9753918401896954, + "num_tokens": 9341118.0, + "step": 4000 + }, + { + "epoch": 9.951432129514322, + "eval_entropy": 0.22201869714745257, + "eval_loss": 0.9477588534355164, + "eval_mean_token_accuracy": 0.8541659501402877, + "eval_num_tokens": 9341118.0, + "eval_runtime": 86.6633, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 4000 + }, + { + "entropy": 0.12383906352214324, + "epoch": 10.0, + "grad_norm": 0.306317538022995, + "learning_rate": 3.799199930972323e-11, + "loss": 0.058901286125183104, + "mean_token_accuracy": 0.9756807119418414, + "num_tokens": 9386580.0, + "step": 4020 + }, + { + "epoch": 10.0, + "eval_entropy": 0.22198900363819543, + "eval_loss": 0.9476598501205444, + "eval_mean_token_accuracy": 0.8541736436444659, + "eval_num_tokens": 9386580.0, + "eval_runtime": 86.5843, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.987, + "step": 4020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 3.964083844973138e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..de447ba6f446520bcf43431893d5eee022e98f39 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-420/trainer_state.json @@ -0,0 +1,475 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0448318804483188, + "eval_steps": 20, + "global_step": 420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.155416952633139e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..35d6869023775ee317b0007965e377dbf888b4a5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-440/trainer_state.json @@ -0,0 +1,496 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0946450809464507, + "eval_steps": 20, + "global_step": 440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.352373181726925e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7eafefe11c9eb1ce15be7f1da15604f08b7ecb90 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-460/trainer_state.json @@ -0,0 +1,517 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1444582814445827, + "eval_steps": 20, + "global_step": 460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.572855012445594e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..731d27270f263e6b46db130f9a6bfe89aeecb020 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-480/trainer_state.json @@ -0,0 +1,538 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1942714819427147, + "eval_steps": 20, + "global_step": 480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.77945126296064e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6389949bb47e969fcc62784a76023708ccbaac58 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-500/trainer_state.json @@ -0,0 +1,559 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.244084682440847, + "eval_steps": 20, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.964191412767334e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7431c54cca80d7bf5d7ad819af6c7d4baf436fec --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-520/trainer_state.json @@ -0,0 +1,580 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.293897882938979, + "eval_steps": 20, + "global_step": 520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.160321867214234e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..adbedab2f6095a227798d5c429279993de6e659b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-540/trainer_state.json @@ -0,0 +1,601 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3437110834371109, + "eval_steps": 20, + "global_step": 540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.344020822900941e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7b06e49f91017a1bc8c9e54698ec92ebedc51faa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-560/trainer_state.json @@ -0,0 +1,622 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3935242839352429, + "eval_steps": 20, + "global_step": 560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.543921118127104e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2c0eea164a5d0f00967f61dd955c0f7059f14d13 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-580/trainer_state.json @@ -0,0 +1,643 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4433374844333748, + "eval_steps": 20, + "global_step": 580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.739225797927117e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ea6de11fd9cb1d92d79d85d67a11b3a90f245ca3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-60/trainer_state.json @@ -0,0 +1,97 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.149439601494396, + "eval_steps": 20, + "global_step": 60, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5653773829644288.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b7850ce4e7bf17a6653a900d5de7b1e97c33e8b3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-600/trainer_state.json @@ -0,0 +1,664 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4931506849315068, + "eval_steps": 20, + "global_step": 600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.93531137331712e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dcd6566a7e4d0ed9ad244e0578ef8080382bc024 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-620/trainer_state.json @@ -0,0 +1,685 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.5429638854296388, + "eval_steps": 20, + "global_step": 620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.147230279980032e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b41e77b995750501cbf50620ab406e2f24d9cd5a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-640/trainer_state.json @@ -0,0 +1,706 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.592777085927771, + "eval_steps": 20, + "global_step": 640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.338594578584576e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..06e962b8b27da5880c2f536efc26c248639459b8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-660/trainer_state.json @@ -0,0 +1,727 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.6425902864259028, + "eval_steps": 20, + "global_step": 660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.516450281063424e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..11a5aab197c8310a23a8c88a8487a9bc0bb007c1 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-680/trainer_state.json @@ -0,0 +1,748 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.692403486924035, + "eval_steps": 20, + "global_step": 680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.728503824897024e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f1b0d804d310f67c95b148fec716180c030de63b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-700/trainer_state.json @@ -0,0 +1,769 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.7422166874221667, + "eval_steps": 20, + "global_step": 700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.93499236567552e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..db673f63554676398607aed8940e354eeceab60e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-720/trainer_state.json @@ -0,0 +1,790 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.792029887920299, + "eval_steps": 20, + "global_step": 720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.120576241751859e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..681681c890db61702c5048dcc8bc598e7a4e58ac --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-740/trainer_state.json @@ -0,0 +1,811 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.841843088418431, + "eval_steps": 20, + "global_step": 740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.32430920843694e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a26c7bace27c5d89d459c69597b9ba01b7ab9882 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-760/trainer_state.json @@ -0,0 +1,832 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.891656288916563, + "eval_steps": 20, + "global_step": 760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.507783768839168e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..470a593a906de5298077be1b2ea770afefd21749 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-780/trainer_state.json @@ -0,0 +1,853 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9414694894146949, + "eval_steps": 20, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.706427450472243e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..eacb6ea661208cb0cf708122b8a2577f65627538 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-80/trainer_state.json @@ -0,0 +1,118 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.199252801992528, + "eval_steps": 20, + "global_step": 80, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7798902991159296.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..021ad51045af2d13b89172cbe7a3061cd0bbfe7c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-800/trainer_state.json @@ -0,0 +1,874 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9912826899128269, + "eval_steps": 20, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.897684039340237e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6bca6d503fd288ba87725cbdf02385d68b4810fe --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-820/trainer_state.json @@ -0,0 +1,895 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0398505603985058, + "eval_steps": 20, + "global_step": 820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.08591129186775e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ceb1ee53a4519906d649ea02aac61d5bd09e02c6 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-840/trainer_state.json @@ -0,0 +1,916 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0896637608966375, + "eval_steps": 20, + "global_step": 840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.296977496449638e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4c1f15076e17560f79837bf6f1e99764620919e3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-860/trainer_state.json @@ -0,0 +1,937 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.1394769613947697, + "eval_steps": 20, + "global_step": 860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.478540209028096e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0606a8f7c430492a184962b786b1e29f0b1c524a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-880/trainer_state.json @@ -0,0 +1,958 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.1892901618929015, + "eval_steps": 20, + "global_step": 880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.682066732051456e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1f24191a0827c29a138d60001fc4b19cee495dff --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-900/trainer_state.json @@ -0,0 +1,979 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2391033623910337, + "eval_steps": 20, + "global_step": 900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.875351854291149e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ead149317a3e844b794f81b82ba71e463b164e3a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-920/trainer_state.json @@ -0,0 +1,1000 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2889165628891655, + "eval_steps": 20, + "global_step": 920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.073672406714573e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8d717a898943078691b1e34460d294d531ca3ed7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-940/trainer_state.json @@ -0,0 +1,1021 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3387297633872977, + "eval_steps": 20, + "global_step": 940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.248826389968282e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2dba324418ead5931a17d6a764182c3e1b663683 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-960/trainer_state.json @@ -0,0 +1,1042 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3885429638854294, + "eval_steps": 20, + "global_step": 960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.454911019234714e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..eb037202d6e02304d118bbaf965155df8df30c18 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.0005183818805460705, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..29f99b01ea4f84c14abc3eb1a74a7ef50d7c0ca1 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-980/trainer_state.json @@ -0,0 +1,1063 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4383561643835616, + "eval_steps": 20, + "global_step": 980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.9784346982836722, + "epoch": 0.049813200498132, + "grad_norm": 3.0229668617248535, + "learning_rate": 9.526142962415369e-06, + "loss": 1.7360023498535155, + "mean_token_accuracy": 0.6449888605624438, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.41506897571475, + "eval_loss": 1.1876318454742432, + "eval_mean_token_accuracy": 0.734131895525511, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.8071, + "eval_samples_per_second": 15.671, + "eval_steps_per_second": 1.959, + "step": 20 + }, + { + "entropy": 1.049924298375845, + "epoch": 0.099626400996264, + "grad_norm": 1.5795097351074219, + "learning_rate": 1.9553661870221022e-05, + "loss": 0.8944448471069336, + "mean_token_accuracy": 0.7748479396104813, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7996658658565476, + "eval_loss": 0.7202735543251038, + "eval_mean_token_accuracy": 0.8070558306089667, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.9199, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.979, + "step": 40 + }, + { + "entropy": 0.7734908878803253, + "epoch": 0.149439601494396, + "grad_norm": 1.3136248588562012, + "learning_rate": 2.9581180778026673e-05, + "loss": 0.6780608654022217, + "mean_token_accuracy": 0.8168170280754566, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7119324009778888, + "eval_loss": 0.6554311513900757, + "eval_mean_token_accuracy": 0.8215604798738346, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.8692, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.98, + "step": 60 + }, + { + "entropy": 0.7071127541363239, + "epoch": 0.199252801992528, + "grad_norm": 1.387060284614563, + "learning_rate": 3.960869968583232e-05, + "loss": 0.6382100582122803, + "mean_token_accuracy": 0.8229366384446621, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6883931482254073, + "eval_loss": 0.625065803527832, + "eval_mean_token_accuracy": 0.828940509710201, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.662, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 80 + }, + { + "entropy": 0.6800824083387852, + "epoch": 0.24906600249066002, + "grad_norm": 0.9892916679382324, + "learning_rate": 4.963621859363797e-05, + "loss": 0.6011715888977051, + "mean_token_accuracy": 0.8323964163661003, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6840810470802839, + "eval_loss": 0.6037028431892395, + "eval_mean_token_accuracy": 0.8309669033732525, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.4637, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 100 + }, + { + "entropy": 0.6776216626167297, + "epoch": 0.298879202988792, + "grad_norm": 0.8918434977531433, + "learning_rate": 5.9663737501443624e-05, + "loss": 0.5991742610931396, + "mean_token_accuracy": 0.8300838828086853, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.690427724705186, + "eval_loss": 0.5939701795578003, + "eval_mean_token_accuracy": 0.8345950186945671, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.6626, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.985, + "step": 120 + }, + { + "entropy": 0.6709842771291733, + "epoch": 0.34869240348692404, + "grad_norm": 0.9135531187057495, + "learning_rate": 6.969125640924927e-05, + "loss": 0.5914147377014161, + "mean_token_accuracy": 0.8314545609056949, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6584504666023476, + "eval_loss": 0.5849721431732178, + "eval_mean_token_accuracy": 0.8357757236375365, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.3262, + "eval_samples_per_second": 15.94, + "eval_steps_per_second": 1.992, + "step": 140 + }, + { + "entropy": 0.6524647936224938, + "epoch": 0.398505603985056, + "grad_norm": 0.8651587963104248, + "learning_rate": 7.971877531705493e-05, + "loss": 0.5710843563079834, + "mean_token_accuracy": 0.8396127380430698, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6283470298661742, + "eval_loss": 0.5738973617553711, + "eval_mean_token_accuracy": 0.8379981181649274, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.5619, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.987, + "step": 160 + }, + { + "entropy": 0.6450445972383022, + "epoch": 0.44831880448318806, + "grad_norm": 0.8661723732948303, + "learning_rate": 8.974629422486058e-05, + "loss": 0.5677794933319091, + "mean_token_accuracy": 0.8389350369572639, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6142613257086554, + "eval_loss": 0.5698265433311462, + "eval_mean_token_accuracy": 0.8388577273418737, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.4443, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 180 + }, + { + "entropy": 0.6448334597051144, + "epoch": 0.49813200498132004, + "grad_norm": 0.9662242531776428, + "learning_rate": 9.977381313266624e-05, + "loss": 0.581433916091919, + "mean_token_accuracy": 0.8387043006718159, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6154296522916749, + "eval_loss": 0.5660303831100464, + "eval_mean_token_accuracy": 0.8412494766850804, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3063, + "eval_samples_per_second": 15.943, + "eval_steps_per_second": 1.993, + "step": 200 + }, + { + "entropy": 0.6376728117465973, + "epoch": 0.547945205479452, + "grad_norm": 0.7618638873100281, + "learning_rate": 0.00010980133204047189, + "loss": 0.5678351402282715, + "mean_token_accuracy": 0.8404546812176704, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6181817033956217, + "eval_loss": 0.5663750171661377, + "eval_mean_token_accuracy": 0.8388350962899452, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.5904, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.986, + "step": 220 + }, + { + "entropy": 0.6303176879882812, + "epoch": 0.597758405977584, + "grad_norm": 0.7571695446968079, + "learning_rate": 0.00011982885094827753, + "loss": 0.5502778053283691, + "mean_token_accuracy": 0.8429657347500324, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6252533817707107, + "eval_loss": 0.5570284128189087, + "eval_mean_token_accuracy": 0.8427327847064927, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.4157, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 240 + }, + { + "entropy": 0.6202544964849949, + "epoch": 0.6475716064757161, + "grad_norm": 0.6447190642356873, + "learning_rate": 0.00012985636985608318, + "loss": 0.5485352993011474, + "mean_token_accuracy": 0.844165726006031, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.6441633552312851, + "eval_loss": 0.5606644153594971, + "eval_mean_token_accuracy": 0.842403513054515, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.6343, + "eval_samples_per_second": 15.883, + "eval_steps_per_second": 1.985, + "step": 260 + }, + { + "entropy": 0.6306711677461863, + "epoch": 0.6973848069738481, + "grad_norm": 0.7869907021522522, + "learning_rate": 0.00013988388876388883, + "loss": 0.5579307556152344, + "mean_token_accuracy": 0.841247134655714, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.6263934678809587, + "eval_loss": 0.5559113025665283, + "eval_mean_token_accuracy": 0.8427334743183713, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.6403, + "eval_samples_per_second": 15.882, + "eval_steps_per_second": 1.985, + "step": 280 + }, + { + "entropy": 0.6385872110724449, + "epoch": 0.7471980074719801, + "grad_norm": 0.6679229736328125, + "learning_rate": 0.0001499114076716945, + "loss": 0.5667279720306396, + "mean_token_accuracy": 0.8389136254787445, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6141417321077612, + "eval_loss": 0.5570600628852844, + "eval_mean_token_accuracy": 0.8437647996253745, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.7588, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 300 + }, + { + "entropy": 0.6199494235217571, + "epoch": 0.797011207970112, + "grad_norm": 0.7924400568008423, + "learning_rate": 0.00015993892657950015, + "loss": 0.5529299736022949, + "mean_token_accuracy": 0.8426973208785057, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6133768925833147, + "eval_loss": 0.556602418422699, + "eval_mean_token_accuracy": 0.8432947965555413, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.492, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.989, + "step": 320 + }, + { + "entropy": 0.6203986253589392, + "epoch": 0.8468244084682441, + "grad_norm": 0.8364354372024536, + "learning_rate": 0.00016996644548730578, + "loss": 0.5551144123077393, + "mean_token_accuracy": 0.8432973213493824, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6017442844634833, + "eval_loss": 0.5566568374633789, + "eval_mean_token_accuracy": 0.8437666123689607, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.5552, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.987, + "step": 340 + }, + { + "entropy": 0.6341533534228802, + "epoch": 0.8966376089663761, + "grad_norm": 0.7783445715904236, + "learning_rate": 0.00017999396439511144, + "loss": 0.5669133186340332, + "mean_token_accuracy": 0.8379446342587471, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6055107958788095, + "eval_loss": 0.5599350333213806, + "eval_mean_token_accuracy": 0.8435030894917112, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.4814, + "eval_samples_per_second": 15.911, + "eval_steps_per_second": 1.989, + "step": 360 + }, + { + "entropy": 0.6306198488920927, + "epoch": 0.9464508094645081, + "grad_norm": 0.8449786901473999, + "learning_rate": 0.0001900214833029171, + "loss": 0.5739435195922852, + "mean_token_accuracy": 0.8393832489848136, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6129532439071078, + "eval_loss": 0.5566295981407166, + "eval_mean_token_accuracy": 0.8430350880290187, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.4643, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.989, + "step": 380 + }, + { + "entropy": 0.6203123550862074, + "epoch": 0.9962640099626401, + "grad_norm": 0.7334314584732056, + "learning_rate": 0.00020004900221072276, + "loss": 0.5547565937042236, + "mean_token_accuracy": 0.8403573960065842, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6275761647279873, + "eval_loss": 0.5621116757392883, + "eval_mean_token_accuracy": 0.841587379228237, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.4748, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.989, + "step": 400 + }, + { + "entropy": 0.5795013002860241, + "epoch": 1.0448318804483188, + "grad_norm": 0.8858296871185303, + "learning_rate": 0.0002015421505577756, + "loss": 0.5183939933776855, + "mean_token_accuracy": 0.850081592034071, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5583065545489622, + "eval_loss": 0.5605642199516296, + "eval_mean_token_accuracy": 0.8439708411000496, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.5422, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.987, + "step": 420 + }, + { + "entropy": 0.5671238023787737, + "epoch": 1.0946450809464507, + "grad_norm": 0.6882498264312744, + "learning_rate": 0.00020150112347025443, + "loss": 0.5077326774597168, + "mean_token_accuracy": 0.8489868573844432, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5868900277933409, + "eval_loss": 0.5602695345878601, + "eval_mean_token_accuracy": 0.8428842161977014, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.623, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.986, + "step": 440 + }, + { + "entropy": 0.5533561781048775, + "epoch": 1.1444582814445827, + "grad_norm": 0.7717723250389099, + "learning_rate": 0.0002014297192297181, + "loss": 0.4954517364501953, + "mean_token_accuracy": 0.8529035650193691, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5600803743961246, + "eval_loss": 0.5608077645301819, + "eval_mean_token_accuracy": 0.8445036771685578, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.1316, + "eval_samples_per_second": 15.976, + "eval_steps_per_second": 1.997, + "step": 460 + }, + { + "entropy": 0.5692154694348573, + "epoch": 1.1942714819427147, + "grad_norm": 0.7322827577590942, + "learning_rate": 0.0002013279593707117, + "loss": 0.505049467086792, + "mean_token_accuracy": 0.8551576808094978, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5732695829383162, + "eval_loss": 0.5594323873519897, + "eval_mean_token_accuracy": 0.8449713407560836, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.2726, + "eval_samples_per_second": 15.949, + "eval_steps_per_second": 1.994, + "step": 480 + }, + { + "entropy": 0.5817618492990733, + "epoch": 1.244084682440847, + "grad_norm": 1.1776764392852783, + "learning_rate": 0.0002011958745826208, + "loss": 0.5137609958648681, + "mean_token_accuracy": 0.8521522544324398, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5662581343636957, + "eval_loss": 0.5595026016235352, + "eval_mean_token_accuracy": 0.8441977164773053, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7261, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5712925456464291, + "epoch": 1.293897882938979, + "grad_norm": 0.7960361838340759, + "learning_rate": 0.0002010335047004159, + "loss": 0.5134767532348633, + "mean_token_accuracy": 0.8513577707111836, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.5441222797299541, + "eval_loss": 0.5535460114479065, + "eval_mean_token_accuracy": 0.8450886118550633, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.2675, + "eval_samples_per_second": 15.95, + "eval_steps_per_second": 1.994, + "step": 520 + }, + { + "entropy": 0.5787045754492283, + "epoch": 1.3437110834371109, + "grad_norm": 0.9205410480499268, + "learning_rate": 0.00020084089869263887, + "loss": 0.5119701862335205, + "mean_token_accuracy": 0.8503516331315041, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.5744457827057949, + "eval_loss": 0.5514978766441345, + "eval_mean_token_accuracy": 0.845929987901865, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.2299, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.995, + "step": 540 + }, + { + "entropy": 0.5739392962306737, + "epoch": 1.3935242839352429, + "grad_norm": 0.7475653886795044, + "learning_rate": 0.00020061811464663464, + "loss": 0.5189042091369629, + "mean_token_accuracy": 0.8492388024926185, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6116398271433142, + "eval_loss": 0.551732063293457, + "eval_mean_token_accuracy": 0.8450756967067719, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.6081, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.986, + "step": 560 + }, + { + "entropy": 0.5755622573196888, + "epoch": 1.4433374844333748, + "grad_norm": 0.8218411803245544, + "learning_rate": 0.00020036521975103286, + "loss": 0.5106248378753662, + "mean_token_accuracy": 0.8506785586476326, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.5906928708386976, + "eval_loss": 0.551278829574585, + "eval_mean_token_accuracy": 0.8462819308042526, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.5438, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.987, + "step": 580 + }, + { + "entropy": 0.5694822132587433, + "epoch": 1.4931506849315068, + "grad_norm": 0.8880652189254761, + "learning_rate": 0.00020008229027548475, + "loss": 0.5140334606170655, + "mean_token_accuracy": 0.8521522797644139, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5599641964532608, + "eval_loss": 0.5501875877380371, + "eval_mean_token_accuracy": 0.8467660788879838, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6458, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.5675108034163714, + "epoch": 1.5429638854296388, + "grad_norm": 0.837087094783783, + "learning_rate": 0.0001997694115476612, + "loss": 0.5099846363067627, + "mean_token_accuracy": 0.8543680295348167, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5728072581249614, + "eval_loss": 0.5445425510406494, + "eval_mean_token_accuracy": 0.8474342175001321, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.4859, + "eval_samples_per_second": 15.91, + "eval_steps_per_second": 1.989, + "step": 620 + }, + { + "entropy": 0.5700885068625212, + "epoch": 1.592777085927771, + "grad_norm": 0.6598765850067139, + "learning_rate": 0.000199426677927519, + "loss": 0.5122694969177246, + "mean_token_accuracy": 0.8519927568733692, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5476993622128353, + "eval_loss": 0.5427973866462708, + "eval_mean_token_accuracy": 0.8478512147138285, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.4172, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.99, + "step": 640 + }, + { + "entropy": 0.5829229176044464, + "epoch": 1.6425902864259028, + "grad_norm": 0.6965194940567017, + "learning_rate": 0.00019905419277884342, + "loss": 0.5253659725189209, + "mean_token_accuracy": 0.8493309423327446, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5666290084983028, + "eval_loss": 0.5467478036880493, + "eval_mean_token_accuracy": 0.8479407703460649, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.4414, + "eval_samples_per_second": 15.918, + "eval_steps_per_second": 1.99, + "step": 660 + }, + { + "entropy": 0.5498311135917902, + "epoch": 1.692403486924035, + "grad_norm": 0.636583685874939, + "learning_rate": 0.00019865206843807482, + "loss": 0.49981012344360354, + "mean_token_accuracy": 0.8560848504304885, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.539117265406043, + "eval_loss": 0.53994220495224, + "eval_mean_token_accuracy": 0.8488582601380903, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.5296, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.988, + "step": 680 + }, + { + "entropy": 0.5543891470879316, + "epoch": 1.7422166874221667, + "grad_norm": 0.6068442463874817, + "learning_rate": 0.0001982204261804297, + "loss": 0.498047399520874, + "mean_token_accuracy": 0.8554679051041603, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5703774151760478, + "eval_loss": 0.5300245881080627, + "eval_mean_token_accuracy": 0.850798153946566, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.6456, + "eval_samples_per_second": 15.881, + "eval_steps_per_second": 1.985, + "step": 700 + }, + { + "entropy": 0.546524541825056, + "epoch": 1.792029887920299, + "grad_norm": 0.7274155020713806, + "learning_rate": 0.00019775939618332566, + "loss": 0.4988589286804199, + "mean_token_accuracy": 0.853422473371029, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5614905688305234, + "eval_loss": 0.5350332260131836, + "eval_mean_token_accuracy": 0.8492204359797544, + "eval_num_tokens": 1681291.0, + "eval_runtime": 86.7581, + "eval_samples_per_second": 15.86, + "eval_steps_per_second": 1.983, + "step": 720 + }, + { + "entropy": 0.5519792139530182, + "epoch": 1.841843088418431, + "grad_norm": 0.663466215133667, + "learning_rate": 0.00019726911748712167, + "loss": 0.5099314212799072, + "mean_token_accuracy": 0.848412600159645, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5583519090053647, + "eval_loss": 0.530483603477478, + "eval_mean_token_accuracy": 0.8500003374593202, + "eval_num_tokens": 1729102.0, + "eval_runtime": 86.3961, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.991, + "step": 740 + }, + { + "entropy": 0.5454779766499996, + "epoch": 1.891656288916563, + "grad_norm": 0.890394926071167, + "learning_rate": 0.00019674973795318548, + "loss": 0.4931994915008545, + "mean_token_accuracy": 0.8540832489728928, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.572755502406941, + "eval_loss": 0.5415747761726379, + "eval_mean_token_accuracy": 0.8444425803284312, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4323, + "eval_samples_per_second": 15.92, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.5392089951783419, + "epoch": 1.9414694894146949, + "grad_norm": 0.632411777973175, + "learning_rate": 0.00019620141421930058, + "loss": 0.4957888603210449, + "mean_token_accuracy": 0.8549866065382957, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.540764772961306, + "eval_loss": 0.5327216386795044, + "eval_mean_token_accuracy": 0.850631088364956, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.8097, + "eval_samples_per_second": 15.851, + "eval_steps_per_second": 1.981, + "step": 780 + }, + { + "entropy": 0.5674678739160299, + "epoch": 1.9912826899128269, + "grad_norm": 0.6958843469619751, + "learning_rate": 0.0001956243116524263, + "loss": 0.504389762878418, + "mean_token_accuracy": 0.8527948908507824, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.530262403190136, + "eval_loss": 0.5308871865272522, + "eval_mean_token_accuracy": 0.8522498046242913, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.7942, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.982, + "step": 800 + }, + { + "entropy": 0.4742849511213792, + "epoch": 2.0398505603985058, + "grad_norm": 0.6941492557525635, + "learning_rate": 0.00019501860429882556, + "loss": 0.418599271774292, + "mean_token_accuracy": 0.8748210859604371, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.504602165069691, + "eval_loss": 0.542878270149231, + "eval_mean_token_accuracy": 0.8507604484641275, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.7841, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 820 + }, + { + "entropy": 0.45857742577791216, + "epoch": 2.0896637608966375, + "grad_norm": 0.5791997909545898, + "learning_rate": 0.00019438447483157478, + "loss": 0.399777889251709, + "mean_token_accuracy": 0.8754058346152306, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.5028848362176918, + "eval_loss": 0.5356478095054626, + "eval_mean_token_accuracy": 0.8525635412959165, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.6707, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.985, + "step": 840 + }, + { + "entropy": 0.4869446292519569, + "epoch": 2.1394769613947697, + "grad_norm": 0.6483516693115234, + "learning_rate": 0.00019372211449547223, + "loss": 0.40715818405151366, + "mean_token_accuracy": 0.875113020837307, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.4928991326759028, + "eval_loss": 0.5419561862945557, + "eval_mean_token_accuracy": 0.8516040146350861, + "eval_num_tokens": 2008562.0, + "eval_runtime": 87.0686, + "eval_samples_per_second": 15.804, + "eval_steps_per_second": 1.975, + "step": 860 + }, + { + "entropy": 0.45819590501487256, + "epoch": 2.1892901618929015, + "grad_norm": 0.6661920547485352, + "learning_rate": 0.00019303172304936108, + "loss": 0.39511430263519287, + "mean_token_accuracy": 0.8780680045485496, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.48602560647698334, + "eval_loss": 0.5436084866523743, + "eval_mean_token_accuracy": 0.8500938470973525, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.6809, + "eval_samples_per_second": 15.874, + "eval_steps_per_second": 1.984, + "step": 880 + }, + { + "entropy": 0.4780638810247183, + "epoch": 2.2391033623910337, + "grad_norm": 0.6870484352111816, + "learning_rate": 0.0001923135087058851, + "loss": 0.4061615467071533, + "mean_token_accuracy": 0.8766494184732437, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.48236206035281337, + "eval_loss": 0.5446090698242188, + "eval_mean_token_accuracy": 0.8507725513258646, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.7398, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.983, + "step": 900 + }, + { + "entropy": 0.463029869645834, + "epoch": 2.2889165628891655, + "grad_norm": 0.6894590854644775, + "learning_rate": 0.00019156768806869427, + "loss": 0.39602413177490237, + "mean_token_accuracy": 0.876420046389103, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.4904779093556626, + "eval_loss": 0.5404934287071228, + "eval_mean_token_accuracy": 0.852238280828609, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.5348, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.988, + "step": 920 + }, + { + "entropy": 0.4817025110125542, + "epoch": 2.3387297633872977, + "grad_norm": 0.7756227254867554, + "learning_rate": 0.00019079448606712033, + "loss": 0.4177968502044678, + "mean_token_accuracy": 0.8712256088852882, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5153802815218305, + "eval_loss": 0.5424937605857849, + "eval_mean_token_accuracy": 0.8506565759348315, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.8973, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.979, + "step": 940 + }, + { + "entropy": 0.46456389091908934, + "epoch": 2.3885429638854294, + "grad_norm": 1.2000319957733154, + "learning_rate": 0.00018999413588834105, + "loss": 0.4084665775299072, + "mean_token_accuracy": 0.8750658087432385, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4849439303195754, + "eval_loss": 0.545662522315979, + "eval_mean_token_accuracy": 0.8491013112456299, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.9049, + "eval_samples_per_second": 15.833, + "eval_steps_per_second": 1.979, + "step": 960 + }, + { + "entropy": 0.4857471022754908, + "epoch": 2.4383561643835616, + "grad_norm": 0.9696341753005981, + "learning_rate": 0.0001891668789070541, + "loss": 0.4149796962738037, + "mean_token_accuracy": 0.8704176343977451, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.4872790058684904, + "eval_loss": 0.5412707924842834, + "eval_mean_token_accuracy": 0.8509329602468846, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.7846, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.982, + "step": 980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.654290717400883e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +}